基于逆优化与先验信念的学徒学习
机器学习
2026-03-02 v2 最优化与控制
摘要
尽管针对马尔可夫决策过程(MDPs)的逆强化学习(IRL)与逆优化(IO)解决的是同一问题,但两者在文献中的关系相对较少被探讨。在本研究中,我们重新审视 MDPs 的 IO 框架、IRL 与学徒学习(AL)之间的关系。我们将关于代价函数结构的先验信念纳入 IRL 和 AL 问题中,并证明 AL 形式化的凸分析视角是我们框架的一种松弛。值得注意的是,当正则化项缺失时,AL 形式化是我们框架的一个特例。针对次优专家设置,我们将 AL 问题表述为一个正则化的极大极小问题。正则化项在引导搜索合理的代价函数方面发挥了关键作用,从而解决了 IRL 的不适定性。为求解由此产生的正则化凸凹极大极小问题,我们使用了随机镜像下降法(SMD),并为所提出的方法建立了收敛界。数值实验突出了正则化在学习代价向量和学徒策略中的关键作用。
引用
@article{arxiv.2505.21639,
title = {Apprenticeship learning with prior beliefs using inverse optimization},
author = {Mauricio Junca and Esteban Leiva},
journal= {arXiv preprint arXiv:2505.21639},
year = {2026}
}