中文

面向重尾多臂老虎机的自适应兼得算法

机器学习 2022-06-14 v2

摘要

本文将重尾多臂老虎机(MAB)的概念推广至对抗环境,并针对损失具有 α\alpha 阶(1<α21<\alpha\le 2)矩以 σα\sigma^\alpha 为界、而方差可能不存在的重尾多臂老虎机,开发了鲁棒的兼得(best-of-both-worlds)算法。具体而言,我们设计了算法 \texttt{HTINF}:当智能体已知重尾参数 α\alphaσ\sigma 时,\texttt{HTINF} 在无需先验获知实际环境类型的情况下,同时达到随机与对抗环境下的最优悔值;当 α,σ\alpha,\sigma 未知时,\texttt{HTINF} 在随机情形下取得 logT\log T 风格的依赖于实例的悔值,在对抗情形下取得 o(T)o(T) 的无悔保证。我们进一步开发了算法 \texttt{AdaTINF},即便在对抗设定下、且无需 α\alphaσ\sigma 的先验知识,也实现了 O(σK1\nicefrac1αT\nicefrac1α)\mathcal O(\sigma K^{1-\nicefrac 1\alpha}T^{\nicefrac{1}{\alpha}}) 的极小极大最优悔值。该结果与已知悔值下界(Bubeck 等,2013)相符,而该下界假设了随机环境且 α\alphaσ\sigma 均已知。据我们所知,所提 \texttt{HTINF} 算法是首个享有兼得悔值保证的算法,而 \texttt{AdaTINF} 是首个能自适应 α\alphaσ\sigma 以在经典重尾随机 MAB 设定及我们新提出的对抗表述中达到最优独立于间隙的悔值界的算法。

关键词

引用

@article{arxiv.2201.11921,
  title  = {Adaptive Best-of-Both-Worlds Algorithm for Heavy-Tailed Multi-Armed Bandits},
  author = {Jiatai Huang and Yan Dai and Longbo Huang},
  journal= {arXiv preprint arXiv:2201.11921},
  year   = {2022}
}