逆优化中的学习:内心成本、增广次优性损失与算法
最优化与控制
2024-01-25 v2 机器学习
摘要
在逆优化(IO)中,一个专家智能体求解一个外生信号参数化的优化问题。从学习的视角看,目标是在给定信号及相应最优动作的数据集下学习专家的成本函数。受 IO 一致成本向量集合几何性质的启发,我们引入了“内心(incenter)”概念,这是一种类似于 Besbes 等人(2023)最近提出的圆心(circumcenter)的新概念。在讨论内心成本向量的几何与鲁棒性解释后,我们给出了相应的易处理凸重构形式,与之相反,圆心被证明等价于一个难处理的优化程序。我们进一步提出了一种称为增广次优性损失(ASL)的新损失函数,它是针对不一致数据问题的内心概念的松弛。利用 ASL 的结构,我们提出了一种称为随机近似镜像下降的新的一阶算法。该算法结合了随机与近似次梯度估计以及镜像下降更新步骤,对于具有大基数离散可行集的 IO 问题具有可证明的效率。我们将本文开发的 IO 方法实现为一个名为 InvOpt 的 Python 包。我们的数值实验可复现,底层源代码作为 InvOpt 包中的示例提供。
引用
@article{arxiv.2305.07730,
title = {Learning in Inverse Optimization: Incenter Cost, Augmented Suboptimality Loss, and Algorithms},
author = {Pedro Zattoni Scroccaro and Bilge Atasoy and Peyman Mohajerin Esfahani},
journal= {arXiv preprint arXiv:2305.07730},
year = {2024}
}