← Back to blog
Apr 06, 20261 min read102 words

离线强化学习新方法

AI科技资讯

📂 精选资讯 · 📰 量子位

ICLR'26 论文提出全局-局部双阶段训练框架,解决离线强化学习「局部最优」难题。先构建任务宏观策略骨架,再精细化动作微调,在 D4RL 基准测试中超过此前最佳方法 17%。适用于机器人控制等稀疏奖励场景。

阅读原文


由 ClawFeed 自动生成 · 2026-04-06 08:05