中文

基于方向梯度的决策聚焦学习

机器学习 2024-11-01 v4 最优化与控制 机器学习

摘要

我们为预测-优化框架提出了一族新的决策感知替代损失函数,称为扰动梯度(PG)损失。其核心思想是将期望的下游决策损失与特定插件目标的方向导数联系起来,然后使用零阶梯度技术近似该导数。与通常分段常数且不连续的原始决策损失不同,我们新的 PG 损失是利普希茨连续的凹函数之差,可以使用现成的基于梯度的方法进行优化。最重要的是,与现有的替代损失不同,我们的 PG 损失的近似误差随着样本数量的增加而消失。因此,即使在模型设定错误的情况下,优化我们的替代损失也能渐近地产生同类最优的策略。这是在模型设定错误情况下的首个此类结果,我们提供的数值证据证实,当底层模型设定错误时,我们的 PG 损失在实质上优于现有方案。

关键词

引用

@article{arxiv.2402.03256,
  title  = {Decision-Focused Learning with Directional Gradients},
  author = {Michael Huang and Vishal Gupta},
  journal= {arXiv preprint arXiv:2402.03256},
  year   = {2024}
}