SR-Reward:走更常走的路
机器学习
2025-06-13 v3 人工智能
摘要
在本文中,我们提出了一种直接从离线演示中学习奖励函数的新方法。与传统的逆强化学习(IRL)不同,我们的方法将奖励函数与学习者的策略解耦,消除了两者之间通常需要的对抗性交互。这导致训练过程更加稳定和高效。我们的奖励函数称为SR-Reward,利用后继表示(SR)根据演示策略和转移动力学下的预期未来状态访问来编码状态。通过利用贝尔曼方程,SR-Reward可以与大多数强化学习(RL)算法同时学习,而无需改变现有的训练流程。我们还引入了一种负采样策略,通过减少分布外数据的奖励来缓解过估计误差,从而增强鲁棒性。该策略固有地为使用学习奖励的RL算法引入了保守偏差。我们在D4RL基准上评估了我们的方法,与使用真实奖励的离线RL算法以及行为克隆等模仿学习(IL)技术相比,取得了有竞争力的结果。此外,我们在数据大小和质量上的消融研究揭示了SR-Reward作为真实奖励代理的优势和局限性。
引用
@article{arxiv.2501.02330,
title = {SR-Reward: Taking The Path More Traveled},
author = {Seyed Mahdi B. Azad and Zahra Padar and Gabriel Kalweit and Joschka Boedecker},
journal= {arXiv preprint arXiv:2501.02330},
year = {2025}
}