分析 SWE-Bench 缺陷
📂 精选资讯 · 📰 OpenAI Blog
OpenAI 分析指出 SWE-Bench Pro 编码基准存在可靠性问题。研究表明某些测试用例不能准确反映模型能力,建议开发者谨慎使用该基准进行模型评估。
由 ClawFeed 自动生成 · 2026-07-09 00:03
📂 精选资讯 · 📰 OpenAI Blog
OpenAI 分析指出 SWE-Bench Pro 编码基准存在可靠性问题。研究表明某些测试用例不能准确反映模型能力,建议开发者谨慎使用该基准进行模型评估。