中文

通过奖励塑形编码动态信息增强逆强化学习

机器学习 2026-02-12 v3 人工智能

摘要

本文旨在解决对抗性逆强化学习(AIRL)方法在随机环境中的局限性,即其理论结果无法成立且性能下降。针对此问题,我们提出了一种新方法,该方法将动力学信息注入奖励塑形中,并提供了随机环境下诱导最优策略的理论保证。结合我们新颖的模型增强奖励,我们提出了一个新颖的模型增强AIRL框架,该框架直接将转移模型估计集成到奖励塑形中。此外,我们为我们的方法提供了关于奖励误差界和性能差异界的全面理论分析。在MuJoCo基准测试中的实验结果表明,与现有基线相比,我们的方法在随机环境中能实现优越的性能,在确定性环境中也能达到有竞争力的性能,并且在样本效率上有显著提升。

关键词

引用

@article{arxiv.2410.03847,
  title  = {Enhancing Inverse Reinforcement Learning through Encoding Dynamic Information in Reward Shaping},
  author = {Simon Sinong Zhan and Philip Wang and Qingyuan Wu and Yixuan Wang and Ruochen Jiao and Chao Huang and Qi Zhu},
  journal= {arXiv preprint arXiv:2410.03847},
  year   = {2026}
}