面向多种多臂老虎机游戏的信息最大化
机器学习
2025-03-21 v1 统计力学
机器学习
摘要
信息最大化和自由能最大化是物理学原理,为代理人按照特定目标和政策优化行动提供通用规则。这些原理是设计能够仅凭部分信息就实现高效性能的决策政策的基础。值得注意的是,信息最大化原理在经典老虎机问题中取得了显著成功,最近也被证明可产生针对高斯和亚高斯奖励分布的最优算法。本文探索了基于物理方法的更广泛扩展,以应对更复杂和结构化的老虎机问题。为此,我们涵盖了三种不同的老虎机问题类型,其中信息最大化被调整以获得强大的性能。由于信息最大化的主要挑战在于避免过度探索,我们强调信息如何在各个层面上被量身定制,以缓解这一问题,为更高效和更稳健的决策策略 paving the way。
引用
@article{arxiv.2503.15962,
title = {Information maximization for a broad variety of multi-armed bandit games},
author = {Alex Barbier-Chebbah and Christian L. Vestergaard and Jean-Baptiste Masson},
journal= {arXiv preprint arXiv:2503.15962},
year = {2025}
}