超越下界:在 lexicographic bandits 中联合优化 regret 最小化与最佳臂识别
机器学习
2025-11-11 v1 人工智能
摘要
在层次化偏好下进行的多目标决策中,lexicographic bandits 提供了一种自然的框架,用于按优先级顺序优化多个目标。在此设置下,学习者反复选择臂位并观察奖励向量,旨在最大化最高优先级目标的奖励,然后是下一个目标,依此类推。虽然以往研究主要关注 regret 最小化,但本工作在 lexicographic 偏好下,桥接了"regret 最小化"与"最佳臂识别"之间的鸿沟。我们提出两种基于消除的算法以应对这一联合目标。第一种算法按目标优先级依次消除次优臂位,实现的样本复杂度和 regret 界限与最佳单目标算法相当。第二种算法在每个回合中同时利用来自所有目标的信息,有效地利用跨目标依赖性。惊人的是,它超越了已知的单目标 bandit 问题的下界,凸显了多目标情境下跨目标信息共享的优势。实验结果进一步验证了其优于基线方法的优越性能。
引用
@article{arxiv.2511.05802,
title = {Beyond the Lower Bound: Bridging Regret Minimization and Best Arm Identification in Lexicographic Bandits},
author = {Bo Xue and Yuanyu Wan and Zhichao Lu and Qingfu Zhang},
journal= {arXiv preprint arXiv:2511.05802},
year = {2025}
}
备注
Accepted by AAAI 2026