中文

约束线性 Thompson 采样

机器学习 2025-06-19 v2

摘要

我们研究安全线性老虎机(SLBs),其中智能体在每一轮从凸集中选择动作,以在满足未知线性约束的条件下最大化未知线性目标。现有的 SLB 方法提供了强有力的遗憾保证,但需要求解昂贵的优化问题(例如,二阶锥、NP 难规划)。为了解决这个问题,我们提出了约束线性 Thompson 采样(COLTS),这是一个基于采样的框架,通过求解扰动线性规划来选择动作,在匹配先前方法的遗憾和风险的同时,显著降低了计算成本。我们开发了两个主要变体:S-COLTS,在给定安全动作的情况下确保零风险和 O~(d3T)\widetilde{O}(\sqrt{d^3 T}) 的遗憾;以及 R-COLTS,在无实例信息的情况下实现 O~(d3T)\widetilde{O}(\sqrt{d^3 T}) 的遗憾和风险。在仿真中,这些方法匹配或优于最先进的 SLB 方法,同时大幅提高了可扩展性。在技术层面,我们引入了一种新颖的耦合噪声设计,确保对真实最优解频繁保持“局部乐观”,并采用基于缩放的分析来处理约束的逐轮可变性。

关键词

引用

@article{arxiv.2503.02043,
  title  = {Constrained Linear Thompson Sampling},
  author = {Aditya Gangrade and Venkatesh Saligrama},
  journal= {arXiv preprint arXiv:2503.02043},
  year   = {2025}
}