统计视角下人工智能中 Bandit 问题的选择性综述
机器学习
2025-02-20 v3 人工智能
机器学习
计量经济学
概率论
摘要
强化学习 (RL) 是人工智能中广泛研究的领域,旨在通过与环境交互教导代理人做出决策。其关键子集包括随机多臂老虎机 (MAB) 和连续老虎机 (SCAB) 问题,这些问题在不确定性下建模序列决策。本综述概述了老虎机问题的基础模型与假设,探讨了如浓度不等式和最小后悔界等非渐近理论工具,并比较了频率主义和贝叶斯算法在管理探索-开发权衡方面的作用。此外,我们还探讨了 K 臂情境老虎机和 SCAB,聚焦其方法论与后悔分析。我们还检查了 SCAB 问题与函数数据分析之间的联系。最后,我们概述了该领域的最新进展与持续挑战。
引用
@article{arxiv.2412.02251,
title = {Selective Reviews of Bandit Problems in AI via a Statistical View},
author = {Pengjie Zhou and Haoyu Wei and Huiming Zhang},
journal= {arXiv preprint arXiv:2412.02251},
year = {2025}
}
备注
52 pages, 5 figures