中文

改进的 Regret 与 Pandora's Box 和先知不等式的情境线性扩展

机器学习 2025-10-27 v2 数据结构与算法 计算机科学与博弈论

摘要

我们在半带反馈(semi-bandit feedback)的在线学习setting 中研究 Pandora's Box 问题。在每一轮中,学习者依次支付费用打开最多 nn 个具有未知奖励分布的盒子,观察打开后的奖励,并决定何时停止。学习者的效用为观察到的最大奖励减去所打开盒子的累计成本,目标是最小化定义为累计预期效用与最优策略之间差距的 Regret。我们提出了一种新的算法,在 TT 轮后实现 O~(nT)\widetilde{O}(\sqrt{nT}) 的 Regret,这改进了 Agarwal 等人 [2024] 的 O~(nT)\widetilde{O}(n\sqrt{T}) 上界,并在对数因子上接近已知下界。为了更好地捕捉现实应用,我们将结果扩展到一种自然但具有挑战性的情境线性 setting,即每个盒子的预期奖励是线性的,取决于已知但随时间变化的 dd 维情境,且噪声分布在时间上保持不变。我们设计了一种学习线性函数和噪声分布的算法,实现 O~(ndT)\widetilde{O}(nd\sqrt{T}) 的 Regret。最后,我们表明我们的方法也适用于在线先知不等式(online Prophet Inequality)问题,即学习者必须立即决定是否接受一个已揭示的奖励。在非情境和情境两种 setting 中,我们的方法实现了类似的改进和 Regret 上界。

关键词

引用

@article{arxiv.2505.18828,
  title  = {Improved Regret and Contextual Linear Extension for Pandora's Box and Prophet Inequality},
  author = {Junyan Liu and Ziyun Chen and Kun Wang and Haipeng Luo and Lillian J. Ratliff},
  journal= {arXiv preprint arXiv:2505.18828},
  year   = {2025}
}

备注

31 pages, NeurIPS 2025