对抗性资源约束下的无悔学习:支出计划就是你所需的一切!
机器学习
2025-06-19 v3 人工智能
机器学习
摘要
我们研究资源约束下的在线决策问题,其中奖励函数与代价函数均取自可能随时间对抗性变化的分布。我们聚焦于两个典型场景: 在线资源分配,其中奖励与代价在动作选择之前被观测到;以及 在线学习与资源约束,其中它们在动作选择之后被观测到,分别在全反馈和 bandit 反馈条件下。众所周知,当奖励与代价分布可能任意随时间变化时,在这些场景下实现次线性遗憾是不可能的。为应对这一挑战,我们分析了一种由支出计划引导学习者的框架——支出计划是一个 prescribing 各轮期望资源使用的序列。我们设计了通用的 (原始-对偶) 方法,能够相对于遵循支出计划的基线实现次线性遗憾。关键的是,当支出计划确保预算在各轮之间分布均衡时,我们算法的性能会显著提升。我们还提供了鲁棒变体,以处理支出计划严重失衡的最坏情况。最后,我们研究了当与偏离规定支出计划的基线竞争时,我们算法的遗憾表现。
引用
@article{arxiv.2506.13244,
title = {No-Regret Learning Under Adversarial Resource Constraints: A Spending Plan Is All You Need!},
author = {Francesco Emanuele Stradi and Matteo Castiglioni and Alberto Marchesi and Nicola Gatti and Christian Kroer},
journal= {arXiv preprint arXiv:2506.13244},
year = {2025}
}