基于混合正则化器的优化探索:部分监控中具有对抗鲁棒性的对数遗憾
机器学习
2025-02-18 v2 机器学习
摘要
部分监控是一类具有有限反馈的在线决策问题的通用框架。为了从这种有限反馈中做出决策,必须找到合适的探索分布。最近,为此目的提出了一种强大的方法,即\emph{基于优化的探索}(ExO),该方法结合跟随正则化领导者(follow-the-regularized-leader),在广泛的在线决策问题中实现了对抗环境下的最优界。然而,在随机环境中朴素地应用 ExO 会显著恶化遗憾界。为了解决局部可观测博弈中的这一问题,我们首先为具有混合正则化器的 ExO 建立了一个新的框架和分析。这一进展使我们能够显著改进“两全其美”(BOBW)算法的现有遗憾界,该算法在随机和对抗环境中均能实现近乎最优的界。特别是,我们推导出了 的随机遗憾界,其中 、 和 分别是动作数、观测数和轮次数, 是最优动作, 是动作 的次优间隙。该界限大约比现有的 BOBW 界限小 倍。此外,对于全局可观测博弈,我们提供了一种新的 BOBW 算法,并给出了首个 随机界。
引用
@article{arxiv.2402.08321,
title = {Exploration by Optimization with Hybrid Regularizers: Logarithmic Regret with Adversarial Robustness in Partial Monitoring},
author = {Taira Tsuchiya and Shinji Ito and Junya Honda},
journal= {arXiv preprint arXiv:2402.08321},
year = {2025}
}
备注
Published version in Proceedings of 41st International Conference on Machine Learning (ICML 2024), 23 pages