通过移位感知奖励学习消除模型基离线强化学习中的分布迁移
机器学习
2025-10-28 v3 机器学习
摘要
模型基离线强化学习利用预收集的数据集和学习的环境模型来训练策略,无需直接与真实环境交互。然而,这一范式天然受分布迁移 (DS) 的挑战。现有方法通过利用离策略机制和估计模型不确定性来解决此问题,但常导致目标不一致且缺乏统一的理论基础。本文提供了全面的分析,将问题解耦为两个基本组成部分:模型偏差和策略迁移。我们的理论和实证研究揭示了这些因素如何扭曲价值估计并限制策略优化。为解决这些挑战,我们推导了通过统一概率推断框架衍生的移位感知奖励,该奖励修改原始奖励以细化价值学习并促进策略训练。基于此,我们开发了一种实用方法,利用基于分类器的技术来近似调整后的奖励,以实现有效的策略优化。在多个基准测试上的实验结果表明,所提方法消除了分布迁移并实现了优于或相当于现有方法的优异性能,验证了我们的理论见解。
引用
@article{arxiv.2408.12830,
title = {Mitigating Distribution Shift in Model-based Offline RL via Shifts-aware Reward Learning},
author = {Wang Luo and Haoran Li and Zicheng Zhang and Congying Han and Chi Zhou and Jiayu Lv and Tiande Guo},
journal= {arXiv preprint arXiv:2408.12830},
year = {2025}
}