多臂老虎机的改进型双赢保证:带一般正则化项与多个最优臂的 FTRL
机器学习
2023-10-27 v2 机器学习
摘要
我们研究设计自适应多臂老虎机(multi-armed bandit)算法的问题,这类算法能在随机设定和对抗设定下同时达到最优性能(常被称为双赢保证)。一系列近期工作表明,当被正确配置和分析时,原本为对抗设定设计的 Follow-the-Regularized-Leader(FTRL)算法实际上也能最优地适应随机设定。然而,此类结果关键依赖于存在唯一最优臂的假设。最近,Ito(2021)迈出了第一步,针对带有 -Tsallis 熵正则化项的某一特定 FTRL 算法去除了这一不理想的唯一性假设。在本工作中,我们显著改进并推广了该结果,表明对于具有广泛正则化项家族和一种新的学习率调度方案的 FTRL,唯一性并非必要。对于某些正则化项,即便在唯一性成立时,我们的后悔界也优于先前结果。我们进一步将结果应用于解耦探索与利用问题,表明我们的技术具有广泛适用性。
引用
@article{arxiv.2302.13534,
title = {Improved Best-of-Both-Worlds Guarantees for Multi-Armed Bandits: FTRL with General Regularizers and Multiple Optimal Arms},
author = {Tiancheng Jin and Junyan Liu and Haipeng Luo},
journal= {arXiv preprint arXiv:2302.13534},
year = {2023}
}
备注
Update the camera-ready version for NeurIPS 2023