中文

基于逆优化与先验信念的学徒学习

机器学习 2026-03-02 v2 最优化与控制

摘要

尽管针对马尔可夫决策过程(MDPs)的逆强化学习(IRL)与逆优化(IO)解决的是同一问题,但两者在文献中的关系相对较少被探讨。在本研究中,我们重新审视 MDPs 的 IO 框架、IRL 与学徒学习(AL)之间的关系。我们将关于代价函数结构的先验信念纳入 IRL 和 AL 问题中,并证明 AL 形式化的凸分析视角是我们框架的一种松弛。值得注意的是,当正则化项缺失时,AL 形式化是我们框架的一个特例。针对次优专家设置,我们将 AL 问题表述为一个正则化的极大极小问题。正则化项在引导搜索合理的代价函数方面发挥了关键作用,从而解决了 IRL 的不适定性。为求解由此产生的正则化凸凹极大极小问题,我们使用了随机镜像下降法(SMD),并为所提出的方法建立了收敛界。数值实验突出了正则化在学习代价向量和学徒策略中的关键作用。

关键词

引用

@article{arxiv.2505.21639,
  title  = {Apprenticeship learning with prior beliefs using inverse optimization},
  author = {Mauricio Junca and Esteban Leiva},
  journal= {arXiv preprint arXiv:2505.21639},
  year   = {2026}
}