中文

基于凸优化的逆强化学习

机器学习 2025-06-27 v2 计算工程、金融与科学 最优化与控制 神经元与认知

摘要

我们考虑逆强化学习 (IRL) 问题,即根据观察到的专家演示估计某个马尔可夫决策过程中未知的奖励函数。在大多数现有方法中,IRL 被形式化并求解为非凸优化问题,这在需要鲁棒性和可重复性的场景中提出了挑战。我们讨论了 Ng 和 Russel 初次提出的 IRL 的凸形式 (CIRL),并将问题重新表述为可以直接应用特定于领域的语言 CVXPY 来指定和求解凸问题。我们还将 CIRL 问题扩展到专家策略不是以解析形式给出而是以轨迹形式给出(即状态-动作对)的场景,这些轨迹可能与最优性强烈不一致,通过增添一些约束来实现。引入了关于超参数自动选择的理论分析和实际实现。这篇笔记帮助用户无需凸优化背景知识即可轻松地将 CIRL 应用于自己的问题。

关键词

引用

@article{arxiv.2501.15957,
  title  = {Inverse Reinforcement Learning via Convex Optimization},
  author = {Hao Zhu and Yuan Zhang and Joschka Boedecker},
  journal= {arXiv preprint arXiv:2501.15957},
  year   = {2025}
}