中文

情境型多臂老虎机策略优化的最优后悔理论

机器学习 2026-02-17 v1

摘要

我们提出了首个针对具有一般离线函数逼近的随机情境多臂老虎机(CMAB)问题所应用的策略优化技术所获得的最高概率最优后悔界。我们的算法既高效又实现了 O~(KAlogF)\widetilde{O}(\sqrt{ K|\mathcal{A}|\log|\mathcal{F}|}) 的最优后悔界,其中 KK 为轮数,A\mathcal{A} 为臂的集合,F\mathcal{F} 为用于逼近损失的函数类。我们的结果桥接了理论与实践之间的差距,表明在情境老虎机问题中广泛使用的策略优化方法可实现严格证明的最优后悔界。我们通过对算法的经验评估支持了理论结果。

关键词

引用

@article{arxiv.2602.13700,
  title  = {Optimal Regret for Policy Optimization in Contextual Bandits},
  author = {Orin Levy and Yishay Mansour},
  journal= {arXiv preprint arXiv:2602.13700},
  year   = {2026}
}