随机多目标臂虫是否比单目标臂虫更难?
机器学习
2026-05-08 v2 机器学习
摘要
多目标臂虫因其广泛的适用性而受到越来越多的关注,维奖励向量导致帕累托后悔。关于这一额外结构是否使问题在本质上比单目标臂虫更难,已存在细微的争论。我们通过表明帕累托后悔 surprisingly并不更难来回答这个问题:帕累托后悔按 (目标级最大次优性间隙)的倒数比例缩放,从而匹配帕累托最优臂的最小目标级经典后悔。我们通过一种新方法实现这一思想,为每个臂-目标对构建上下和下置信界估计器。它使用顶二赛跑在每个目标内比较臂位于,以及一种不确定性贪婪规则以分配探索向最大目标级间隙 ,直到对应帕累托最优臂被提交。我们证明它实现了 的帕累托后悔,其中 为时域,**不依赖于 **。一个匹配的下界 表明其最优。我们在合成数据和真实世界数据上评估该方法,验证了理论并实现了对基线的数量级帕累托后悔降低。真实世界结果进一步表明,我们的方法提交了一个帕累托最优臂,可能以经验公平性为代价,表明单目标臂虫中可能不存在的硬度。
引用
@article{arxiv.2604.07096,
title = {Are Stochastic Multi-objective Bandits Harder than Single-objective Bandits?},
author = {Changkun Guan and Mengfan Xu},
journal= {arXiv preprint arXiv:2604.07096},
year = {2026}
}
备注
21 pages