中文

多臂赌博机问题的频域分析:探索-利用权衡的新视角

机器学习 2025-10-13 v1 人工智能 信息论 math.IT 最优化与控制 机器学习

摘要

随机多臂赌博机(MAB)问题是序贯决策中最基础的模型之一,其核心挑战在于探索与利用之间的权衡。虽然上置信界(UCB)和汤普森采样(Thompson Sampling)等算法及其遗憾理论已较为成熟,但现有分析主要基于时间域和累积遗憾视角,难以刻画学习过程的动态特性。本文提出一种新颖的频域分析框架,将赌博机过程重新表述为信号处理问题。在该框架中,每个臂的奖励估计被视为一个谱分量,其不确定性对应于该分量的频率,而赌博机算法被解释为一个自适应滤波器。我们构建了形式化的频域赌博机模型,并证明了主要定理:UCB算法中的置信界项在频域中等价于施加于不确定谱分量上的时变增益,该增益与访问次数的平方根成反比。基于此,我们进一步推导了关于探索率衰减的有限时间动态界。该理论不仅为经典算法提供了新颖直观的物理诠释,也为设计具有自适应参数调节的下一代算法奠定了严格的理论基础。

关键词

引用

@article{arxiv.2510.08908,
  title  = {A Frequency-Domain Analysis of the Multi-Armed Bandit Problem: A New Perspective on the Exploration-Exploitation Trade-off},
  author = {Di Zhang},
  journal= {arXiv preprint arXiv:2510.08908},
  year   = {2025}
}

备注

6 pages