占用奖励塑形:改进离线目标条件强化学习的信用分配
机器学习
2026-04-23 v1 机器人学
摘要
动作与其长期后果之间的时间滞后使得从数据中学习目标导向行为时,信用分配成为一个挑战。生成式世界模型捕获了智能体可能访问的未来状态的分布,这表明它们已经捕获了时间信息。如何提取这些时间信息来执行信用分配?在本文中,我们形式化了存储在世界模型中的时间信息如何编码世界的底层几何结构。利用最优传输,我们从学习到的占用测度模型中提取这种几何结构,并将其转化为一个捕获目标到达信息的奖励函数。我们提出的方法,占用奖励塑形(ORS),在很大程度上缓解了稀疏奖励设置中的信用分配问题。ORS在理论上被证明不会改变最优策略,但在13个多样化的长时域运动和操作任务中,经验性地将性能提高了2.2倍。此外,我们在真实世界中展示了ORS在3个托卡马克控制任务上控制核聚变的有效性。代码:https://github.com/aravindvenu7/occupancy_reward_shaping;网站:https://aravindvenu7.github.io/website/ors/
引用
@article{arxiv.2604.20627,
title = {Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning},
author = {Aravind Venugopal and Jiayu Chen and Xudong Wu and Chongyi Zheng and Benjamin Eysenbach and Jeff Schneider},
journal= {arXiv preprint arXiv:2604.20627},
year = {2026}
}
备注
ICLR 2026