中文

超越下界:在 lexicographic bandits 中联合优化 regret 最小化与最佳臂识别

机器学习 2025-11-11 v1 人工智能

摘要

在层次化偏好下进行的多目标决策中,lexicographic bandits 提供了一种自然的框架,用于按优先级顺序优化多个目标。在此设置下,学习者反复选择臂位并观察奖励向量,旨在最大化最高优先级目标的奖励,然后是下一个目标,依此类推。虽然以往研究主要关注 regret 最小化,但本工作在 lexicographic 偏好下,桥接了"regret 最小化"与"最佳臂识别"之间的鸿沟。我们提出两种基于消除的算法以应对这一联合目标。第一种算法按目标优先级依次消除次优臂位,实现的样本复杂度和 regret 界限与最佳单目标算法相当。第二种算法在每个回合中同时利用来自所有目标的信息,有效地利用跨目标依赖性。惊人的是,它超越了已知的单目标 bandit 问题的下界,凸显了多目标情境下跨目标信息共享的优势。实验结果进一步验证了其优于基线方法的优越性能。

关键词

引用

@article{arxiv.2511.05802,
  title  = {Beyond the Lower Bound: Bridging Regret Minimization and Best Arm Identification in Lexicographic Bandits},
  author = {Bo Xue and Yuanyu Wan and Zhichao Lu and Qingfu Zhang},
  journal= {arXiv preprint arXiv:2511.05802},
  year   = {2025}
}

备注

Accepted by AAAI 2026