中文

统计视角下人工智能中 Bandit 问题的选择性综述

机器学习 2025-02-20 v3 人工智能 机器学习 计量经济学 概率论

摘要

强化学习 (RL) 是人工智能中广泛研究的领域,旨在通过与环境交互教导代理人做出决策。其关键子集包括随机多臂老虎机 (MAB) 和连续老虎机 (SCAB) 问题,这些问题在不确定性下建模序列决策。本综述概述了老虎机问题的基础模型与假设,探讨了如浓度不等式和最小后悔界等非渐近理论工具,并比较了频率主义和贝叶斯算法在管理探索-开发权衡方面的作用。此外,我们还探讨了 K 臂情境老虎机和 SCAB,聚焦其方法论与后悔分析。我们还检查了 SCAB 问题与函数数据分析之间的联系。最后,我们概述了该领域的最新进展与持续挑战。

关键词

引用

@article{arxiv.2412.02251,
  title  = {Selective Reviews of Bandit Problems in AI via a Statistical View},
  author = {Pengjie Zhou and Haoyu Wei and Huiming Zhang},
  journal= {arXiv preprint arXiv:2412.02251},
  year   = {2025}
}

备注

52 pages, 5 figures