基于智能预测后优化方法的在线上下文决策
机器学习
2022-06-16 v1 最优化与控制
机器学习
摘要
我们研究一类带资源约束的在线上下文决策问题。在每个时段,决策者首先基于给定的上下文向量预测奖励向量与资源消耗矩阵,然后求解下游优化问题以做出决策。决策者的最终目标是在满足资源约束的同时,最大化奖励与资源消耗效用的总和。我们提出一种算法,将基于“智能预测后优化(Smart Predict-then-Optimize, SPO)”方法的预测步骤与基于镜像下降的对偶更新步骤相结合。我们证明了遗憾界,并表明我们方法的整体收敛速率依赖于在线镜像下降的 收敛性以及用于学习预测模型的替代损失函数的风险界。我们的算法与遗憾界适用于资源约束的一般凸可行域,包括硬与软资源约束情形,并且相较于线性上下文模型或有限策略空间的传统设定,适用于广泛的预测模型类别。我们还进行了数值实验,在多维背包与最长路径实例上实证展示了所提 SPO 类方法相对于传统仅预测误差方法的优势。
引用
@article{arxiv.2206.07316,
title = {Online Contextual Decision-Making with a Smart Predict-then-Optimize Method},
author = {Heyuan Liu and Paul Grigas},
journal= {arXiv preprint arXiv:2206.07316},
year = {2022}
}