中文

基于混合正则化器的优化探索:部分监控中具有对抗鲁棒性的对数遗憾

机器学习 2025-02-18 v2 机器学习

摘要

部分监控是一类具有有限反馈的在线决策问题的通用框架。为了从这种有限反馈中做出决策,必须找到合适的探索分布。最近,为此目的提出了一种强大的方法,即\emph{基于优化的探索}(ExO),该方法结合跟随正则化领导者(follow-the-regularized-leader),在广泛的在线决策问题中实现了对抗环境下的最优界。然而,在随机环境中朴素地应用 ExO 会显著恶化遗憾界。为了解决局部可观测博弈中的这一问题,我们首先为具有混合正则化器的 ExO 建立了一个新的框架和分析。这一进展使我们能够显著改进“两全其美”(BOBW)算法的现有遗憾界,该算法在随机和对抗环境中均能实现近乎最优的界。特别是,我们推导出了 O(aak2m2logT/Δa)O(\sum_{a \neq a^*} k^2 m^2 \log T / \Delta_a) 的随机遗憾界,其中 kkmmTT 分别是动作数、观测数和轮次数,aa^* 是最优动作,Δa\Delta_a 是动作 aa 的次优间隙。该界限大约比现有的 BOBW 界限小 Θ(k2logT)\Theta(k^2 \log T) 倍。此外,对于全局可观测博弈,我们提供了一种新的 BOBW 算法,并给出了首个 O(logT)O(\log T) 随机界。

关键词

引用

@article{arxiv.2402.08321,
  title  = {Exploration by Optimization with Hybrid Regularizers: Logarithmic Regret with Adversarial Robustness in Partial Monitoring},
  author = {Taira Tsuchiya and Shinji Ito and Junya Honda},
  journal= {arXiv preprint arXiv:2402.08321},
  year   = {2025}
}

备注

Published version in Proceedings of 41st International Conference on Machine Learning (ICML 2024), 23 pages