信任区域逆强化学习:基于局部策略更新的显式对偶上升
机器学习
2026-05-13 v1 人工智能
机器人学
摘要
逆强化学习(IRL)通常形式化为在满足专家轨迹分布匹配条件的同时最大化熵。经典的(对偶上升)IRL保证单调性能提升,但需要在每个迭代中完全求解一个RL问题来计算对偶梯度。更近期的对抗方法在避免此成本方面取得进展,但以稳定性和单调对偶改进为代价,通过直接优化原始问题并使用判别器提供奖励。本文通过使奖励函数和策略在无需在每个迭代中完全求解RL问题的情况下实现单调改进,弥合了这两种方法之间的差距。我们的关键理论洞见是,奖励函数更新的信任区域最优策略对于同一方向上的较小更新也是全局最优。这种较小的更新允许我们在仅依赖当前策略附近的局部搜索的情况下显式优化对偶目标。通过这种方式,我们的方法避免了对抗方法的训练不稳定性,实现单调性能提升,并学习一个传统意义上的奖励函数——一种可以全局优化以匹配专家演示的奖励函数。我们提出的算法,信任区域逆强化学习(TRIRL),在多个具有挑战性的任务上相对于最先进的模仿学习方法以约2.4倍的聚合inter-quartile均值实现优势,同时恢复能够泛化到系统动态变化的奖励函数。
引用
@article{arxiv.2605.11020,
title = {Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates},
author = {Anish Diwan and Davide Tateo and Christopher E. Mower and Haitham Bou-Ammar and Jan Peters and Oleg Arenz},
journal= {arXiv preprint arXiv:2605.11020},
year = {2026}
}
备注
Accepted as a conference paper at the International Conference on Machine Learning (ICML) 2026