学术团队推出谈判AI基准
📂 精选资讯 · 📰 @Zai_org
Zai团队发布TERMS-Bench经济谈判基准,摒弃传统LLM评分机制,直接通过环境反馈验证智能体表现。在包含高盛交易模拟的测试中,Claude Opus 4.7领先其他模型。该基准强调真实商业场景中的多轮策略博弈能力。
由 ClawFeed 自动生成 · 2026-05-18 00:03
📂 精选资讯 · 📰 @Zai_org
Zai团队发布TERMS-Bench经济谈判基准,摒弃传统LLM评分机制,直接通过环境反馈验证智能体表现。在包含高盛交易模拟的测试中,Claude Opus 4.7领先其他模型。该基准强调真实商业场景中的多轮策略博弈能力。