中文

论逆强化学习的有效时域

机器学习 2025-02-21 v3 人工智能

摘要

逆强化学习(IRL)算法通常依赖于在给定时域上的(前向)强化学习或规划,以计算假设奖励函数的近似最优策略;随后将该策略与专家示范进行匹配。时域在决定奖励估计的准确性和 IRL 算法的计算效率方面起着关键作用。有趣的是,比真实值更短的有效时域(effective time horizon)往往能更快产生更好的结果。本文正式分析了这一现象并给出解释:时域控制了所诱导策略类的复杂度,并在数据有限时缓解过拟合。该分析为 IRL 有效时域的原则性选择提供了指导。它还促使我们重新审视经典的 IRL 公式:更自然地是联合学习奖励与有效时域,而非在给定时域下仅学习奖励。为验证我们的发现,我们实现了一种交叉验证扩展,实验结果支持了理论分析。项目页面与代码已公开可用。

关键词

引用

@article{arxiv.2307.06541,
  title  = {On the Effective Horizon of Inverse Reinforcement Learning},
  author = {Yiqing Xu and Finale Doshi-Velez and David Hsu},
  journal= {arXiv preprint arXiv:2307.06541},
  year   = {2025}
}

备注

8 pages, accepted to AAMAS 2025