改进的 Regret 与 Pandora's Box 和先知不等式的情境线性扩展
机器学习
2025-10-27 v2 数据结构与算法
计算机科学与博弈论
摘要
我们在半带反馈(semi-bandit feedback)的在线学习setting 中研究 Pandora's Box 问题。在每一轮中,学习者依次支付费用打开最多 个具有未知奖励分布的盒子,观察打开后的奖励,并决定何时停止。学习者的效用为观察到的最大奖励减去所打开盒子的累计成本,目标是最小化定义为累计预期效用与最优策略之间差距的 Regret。我们提出了一种新的算法,在 轮后实现 的 Regret,这改进了 Agarwal 等人 [2024] 的 上界,并在对数因子上接近已知下界。为了更好地捕捉现实应用,我们将结果扩展到一种自然但具有挑战性的情境线性 setting,即每个盒子的预期奖励是线性的,取决于已知但随时间变化的 维情境,且噪声分布在时间上保持不变。我们设计了一种学习线性函数和噪声分布的算法,实现 的 Regret。最后,我们表明我们的方法也适用于在线先知不等式(online Prophet Inequality)问题,即学习者必须立即决定是否接受一个已揭示的奖励。在非情境和情境两种 setting 中,我们的方法实现了类似的改进和 Regret 上界。
引用
@article{arxiv.2505.18828,
title = {Improved Regret and Contextual Linear Extension for Pandora's Box and Prophet Inequality},
author = {Junyan Liu and Ziyun Chen and Kun Wang and Haipeng Luo and Lillian J. Ratliff},
journal= {arXiv preprint arXiv:2505.18828},
year = {2025}
}
备注
31 pages, NeurIPS 2025