面向重尾分布的数据驱动上置置信界及其近最优 regret
机器学习
2024-06-11 v1 机器学习
摘要
随机多臂老虎机 (MAB) 提供了一种基本的强化学习模型,用于研究不确定环境下的序列决策。上置置信界 (UCB) 算法催生了老虎机算法的复兴,因为它在各种矩假设下实现了近最优的 regret。直到最近,大多数 UCB 方法依赖于浓度不等式,导致置信界依赖于矩参数(如方差代理),而这些参数在实际中通常是未知的。本文提出了一种针对对称奖励分布的、无需矩信息的数据驱动 UCB 算法。关键思想是将一种细化的、单侧的最近发展的重抽样中位数-均值 (RMM) 方法与 UCB 结合。我们证明了该提出的无参数、即时 RMM-UCB 方法具有近最优 regret 上界,即便在重尾分布下也如此。
引用
@article{arxiv.2406.05710,
title = {Data-Driven Upper Confidence Bounds with Near-Optimal Regret for Heavy-Tailed Bandits},
author = {Ambrus Tamás and Szabolcs Szentpéteri and Balázs Csanád Csáji},
journal= {arXiv preprint arXiv:2406.05710},
year = {2024}
}