中文

具有对抗性情境的受约束情境型阈

机器学习 2026-05-08 v1

摘要

我们研究受预算约束的对抗性情境型阈问题,其中每种动作产生随机奖励并消耗随机成本。我们采用标准的可实现性假设:在给定情境条件下,奖励和成本独立地从固定分布中抽取,其期望值属于已知函数类。我们关注持续性设置,即算法在整个时段内运行,即使累积成本预算耗尽亦然。在此设置下,目标是同时控制悔 regret 与预算约束违反程度。基于 Foster 等人 [2018] 的经典 SquareCB 框架,我们提出了一个简单且模块化的框架,利用在线回归或acles 将受约束问题降序为具有自适应定义的代理奖励函数的标准无约束情境型阈问题。与先前工作不同,后者专注于随机情境,我们的化简为更一般的对抗性情境提供了改进的保证,并伴随一个高效算法,其分析简洁明了。

关键词

引用

@article{arxiv.2605.06190,
  title  = {Constrained Contextual Bandits with Adversarial Contexts},
  author = {Dhruv Sarkar and Abhishek Sinha},
  journal= {arXiv preprint arXiv:2605.06190},
  year   = {2026}
}