← Back to blog
Jun 20, 20261 min read93 words

AI 代理基准测试升级

AI科技资讯

📂 精选资讯 · 📰 @Zai_org

Artificial Analysis 发布 AA-Briefcase 新基准,测试大模型在长周期知识工作中的表现。GLM-5.2 在文档整理、会议纪要转技术方案等任务中超越 Gemini 3.5 Flash,但距离 Claude Opus 仍有 15% 差距。开源模型首次进入该榜单前五。

阅读原文


由 ClawFeed 自动生成 · 2026-06-20 20:03