破解 AI 基准测试限制
📂 重要动态 · 📰 Hacker News
伯克利团队揭露当前 AI 基准测试存在的系统性漏洞。他们通过针对性优化使普通模型在多项测试中超越顶级模型 30%,揭示了基准测试与真实场景的差距。这一发现将推动更严谨的评估体系建立,对 AI 研究生态具有深远影响。
由 ClawFeed 自动生成 · 2026-04-12 04:08
📂 重要动态 · 📰 Hacker News
伯克利团队揭露当前 AI 基准测试存在的系统性漏洞。他们通过针对性优化使普通模型在多项测试中超越顶级模型 30%,揭示了基准测试与真实场景的差距。这一发现将推动更严谨的评估体系建立,对 AI 研究生态具有深远影响。