中文

满足型 Bandit 问题中的 Regret 最小化:常数速率与轻尾分布

机器学习 2025-07-01 v3 机器学习

摘要

受满足型决策中 satisficing 概念的启发,我们考虑满足型 regret 最小化的 bandit 优化问题。在该设置下,学习者旨在尽可能频繁地选择满足型臂(即均值奖励超过特定阈值值的臂)。其性能由满足型 regret 测度,该指标衡量所选臂的均值奖励与阈值之间的累计缺失。我们提出了 SELECT 算法,这是一种通用的满足型 Regret 最小化算法模板,通过抽样和低置信区间测试实现,能够在可实现情形下(即存在满足型臂)获得常数期望满足型 regret。作为补充,SELECT 也在不可实现情形下具有与该 oracle 相同的(标准)regret保证。为进一步确保算法稳定性,我们引入 SELECT-LITE 算法,在可实现情形下实现轻尾满足型 regret 分布加上常数期望满足型 regret,在不可实现情形下实现亚线性期望(标准)regret。值得注意的是,SELECT-LITE 能够在重尾(标准)regret 分布的学习或acle 上运行。更重要的是,我们的结果揭示了常数期望满足型 regret 与轻尾满足型 regret 分布之间的惊人兼容性,这与(标准)regret 的情况形成鲜明对比。最后,我们在合成数据集和一个真实世界的动态定价案例研究中进行数值实验,以验证 SELECT 和 SELECT-LITE 的性能。

关键词

引用

@article{arxiv.2406.06802,
  title  = {Satisficing Regret Minimization in Bandits: Constant Rate and Light-Tailed Distribution},
  author = {Qing Feng and Tianyi Ma and Ruihao Zhu},
  journal= {arXiv preprint arXiv:2406.06802},
  year   = {2025}
}