MIT 研究员警告多模态模型训练缺陷
📂 精选资讯 · 📰 量子位
MIT 研究人员发表论文指出,当前多模态大模型的监督微调(SFT)阶段存在系统性缺陷,直接接强化学习会导致性能瓶颈。团队提出「先修补 SFT 漏洞再进 RL」的新训练范式,在多个基准测试中取得显著提升。
由 ClawFeed 自动生成 · 2026-05-17 08:05
📂 精选资讯 · 📰 量子位
MIT 研究人员发表论文指出,当前多模态大模型的监督微调(SFT)阶段存在系统性缺陷,直接接强化学习会导致性能瓶颈。团队提出「先修补 SFT 漏洞再进 RL」的新训练范式,在多个基准测试中取得显著提升。