中文

面向长期约束的在线全预测的动态 regret 界限

机器学习 2025-10-09 v1 计算机科学与博弈论

摘要

我们提出了一种算法,保证在面向长期约束的在线全预测中获得动态 regret 界限。该问题的目标是让学习者生成一序列预测,这些预测被广播给一 collection of downstream decision makers。每个 decision maker 都有自己的 utility 函数,以及一组约束函数,每个函数将他们的动作和一个恶意选择的状态映射到奖励或约束违反项。downstream decision makers 的动作是“如同”该状态预测正确一样被选择,学习者的目标是生成预测,使得所有 downstream decision makers 选择的动作能给他们提供最坏情况的 utility 保证,同时最小化最坏情况的约束违反。 在这个 framework 下,我们给出了第一个能够为所有 agent 同时获得动态 regret 保证的算法——其中每个 agent 的 regret 相对于该 agent 在 interaction rounds 中可能变化的动作序列进行衡量,同时确保每个 agent 的约束违反消失。我们的结果不需要 agent 本身维护任何状态——他们只需在该轮由该轮预测定义的单轮约束优化问题中求解。

关键词

引用

@article{arxiv.2510.07266,
  title  = {Dynamic Regret Bounds for Online Omniprediction with Long Term Constraints},
  author = {Yahav Bechavod and Jiuyao Lu and Aaron Roth},
  journal= {arXiv preprint arXiv:2510.07266},
  year   = {2025}
}