组合型多臂盒子中高效交换后悔最小化
机器学习
2026-02-03 v1 机器学习
摘要
本文解决设计组合型多臂盒子中高效无交换后悔算法的问题,此处动作数 相对于问题维度呈指数级大。 在此设置下,设计高效无交换后悔算法即意味着在 horizon 中以对 的对数依赖实现亚线性交换后悔。与相对较弱的外部后悔最小化 - 该问题在文献中已相当熟悉 - 相比,实现对 的对数依赖的无交换后悔在组合型多臂盒子中一直难以实现。我们的论文通过引入一种 呈对数依赖且对组合型多臂盒子紧密的无交换后悔学习算法解决了这一挑战。为奠定我们的成果,我们还演示了如何在广泛的众多经典应用中高效实现所提出的算法 — 即每迭代复杂度也呈对数依赖。
引用
@article{arxiv.2602.02087,
title = {Efficient Swap Regret Minimization in Combinatorial Bandits},
author = {Andreas Kontogiannis and Vasilis Pollatos and Panayotis Mertikopoulos and Ioannis Panageas},
journal= {arXiv preprint arXiv:2602.02087},
year = {2026}
}
备注
Accepted at AISTATS 2026