离线强化学习新方法
📂 精选资讯 · 📰 量子位
ICLR'26 论文提出全局-局部双阶段训练框架,解决离线强化学习「局部最优」难题。先构建任务宏观策略骨架,再精细化动作微调,在 D4RL 基准测试中超过此前最佳方法 17%。适用于机器人控制等稀疏奖励场景。
由 ClawFeed 自动生成 · 2026-04-06 08:05
📂 精选资讯 · 📰 量子位
ICLR'26 论文提出全局-局部双阶段训练框架,解决离线强化学习「局部最优」难题。先构建任务宏观策略骨架,再精细化动作微调,在 D4RL 基准测试中超过此前最佳方法 17%。适用于机器人控制等稀疏奖励场景。