重新审视在带不界扰动的 bandit 问题中以扰动跟随领袖策略
机器学习
2025-08-27 v1 机器学习
摘要
Follow-the-Regularized-Leader(FTRL)策略通过混合正则化器在各种情境下实现了最佳双重世界(BOBW)结果,而Follow-the-Perturbed-Leader(FTPL)的类似结果却受限于固有的分析挑战。为推进 FTPL 的分析基础,本文重审经典的 FTRL-FTPL 双关关系,针对广泛的非对称无界扰动,建立了 BOBW 结果,其中包括结合 Gumbel 类型与 Fréchet 类型尾部的混合扰动。这些结果不仅扩展了 FTPL 的 BOBW 结果,还为设计与混合正则化方法等价的 FTPL 策略提供了新见解。鼓励前人在两臂 bandit 中的观察,我们进一步探讨 -Tsallis 熵与 Fréchet 类型扰动之间的联系。我们的数值观察表明,它对应于对称 Fréchet 类型扰动,基于此,我们首次在两臂情形下建立了对称无界扰动的 BOBW 保证。在一般多臂 bandit 中,我们发现对称 Fréchet 类型扰动违反标准 BOBW 分析的关键条件——而这在非对称或非负 Fréchet 类型扰动中并未出现。尽管该例并不否定通过替代分析实现 BOBW 结果的可能性,但它表明将两臂情形中观察到的关系直接推广至一般情形存在局限性,从而凸显了为更广泛的情境彻底理解 FTPL 行为的必要性。
引用
@article{arxiv.2508.18604,
title = {Revisiting Follow-the-Perturbed-Leader with Unbounded Perturbations in Bandit Problems},
author = {Jongyeong Lee and Junya Honda and Shinji Ito and Min-hwan Oh},
journal= {arXiv preprint arXiv:2508.18604},
year = {2025}
}
备注
Preprint