中文

随机多目标臂虫是否比单目标臂虫更难?

机器学习 2026-05-08 v2 机器学习

摘要

多目标臂虫因其广泛的适用性而受到越来越多的关注,dd维奖励向量导致帕累托后悔。关于这一额外结构是否使问题在本质上比单目标臂虫更难,已存在细微的争论。我们通过表明帕累托后悔 surprisingly并不更难来回答这个问题:帕累托后悔按 gg^\dagger(目标级最大次优性间隙)的倒数比例缩放,从而匹配帕累托最优臂的最小目标级经典后悔。我们通过一种新方法实现这一思想,为每个臂-目标对构建上下和下置信界估计器。它使用顶二赛跑在每个目标内比较臂位于,以及一种不确定性贪婪规则以分配探索向最大目标级间隙 gg^\dagger,直到对应帕累托最优臂被提交。我们证明它实现了 O(\nicefraclogTg)O(\nicefrac{\log T}{g^\dagger}) 的帕累托后悔,其中 TT 为时域,**不依赖于 dd**。一个匹配的下界 Ω(\nicefraclogTg)\Omega(\nicefrac{\log T}{g^\dagger}) 表明其最优。我们在合成数据和真实世界数据上评估该方法,验证了理论并实现了对基线的数量级帕累托后悔降低。真实世界结果进一步表明,我们的方法提交了一个帕累托最优臂,可能以经验公平性为代价,表明单目标臂虫中可能不存在的硬度。

关键词

引用

@article{arxiv.2604.07096,
  title  = {Are Stochastic Multi-objective Bandits Harder than Single-objective Bandits?},
  author = {Changkun Guan and Mengfan Xu},
  journal= {arXiv preprint arXiv:2604.07096},
  year   = {2026}
}

备注

21 pages