中文

基于智能预测后优化方法的在线上下文决策

机器学习 2022-06-16 v1 最优化与控制 机器学习

摘要

我们研究一类带资源约束的在线上下文决策问题。在每个时段,决策者首先基于给定的上下文向量预测奖励向量与资源消耗矩阵,然后求解下游优化问题以做出决策。决策者的最终目标是在满足资源约束的同时,最大化奖励与资源消耗效用的总和。我们提出一种算法,将基于“智能预测后优化(Smart Predict-then-Optimize, SPO)”方法的预测步骤与基于镜像下降的对偶更新步骤相结合。我们证明了遗憾界,并表明我们方法的整体收敛速率依赖于在线镜像下降的 O(T1/2)\mathcal{O}(T^{-1/2}) 收敛性以及用于学习预测模型的替代损失函数的风险界。我们的算法与遗憾界适用于资源约束的一般凸可行域,包括硬与软资源约束情形,并且相较于线性上下文模型或有限策略空间的传统设定,适用于广泛的预测模型类别。我们还进行了数值实验,在多维背包与最长路径实例上实证展示了所提 SPO 类方法相对于传统仅预测误差方法的优势。

关键词

引用

@article{arxiv.2206.07316,
  title  = {Online Contextual Decision-Making with a Smart Predict-then-Optimize Method},
  author = {Heyuan Liu and Paul Grigas},
  journal= {arXiv preprint arXiv:2206.07316},
  year   = {2022}
}