中文

偏好中心定制下可证明高效的多目标赌博机算法

机器学习 2025-11-18 v2

摘要

多目标多臂赌博机 (MO-MAB) 问题传统上旨在实现帕累托最优。然而,现实场景通常涉及对不同目标有不同偏好的用户,导致一个帕累托最优臂可能对某一用户得分很高,但对另一用户表现极差。这突出了定制化学习的需求,而这一因素在以往研究中常被忽视。为了解决这一问题,我们在存在显式用户偏好的情况下研究了一个偏好感知的 MO-MAB 框架。它将重点从实现帕累托最优转移到在偏好中心定制下在帕累托前沿内进一步优化。据我们所知,这是首次对具有显式用户偏好的定制化 MO-MAB 优化进行理论研究。受实际应用启发,我们探索了两种场景:未知偏好和隐藏偏好,每种场景都为算法设计和分析带来了独特的挑战。我们算法的核心是偏好估计和偏好感知优化机制,以有效适应用户偏好。我们进一步开发了新的分析技术,以确立所提算法的近最优遗憾界。强有力的实证表现证实了我们方法的有效性。

关键词

引用

@article{arxiv.2502.13457,
  title  = {Provably Efficient Multi-Objective Bandit Algorithms under Preference-Centric Customization},
  author = {Linfeng Cao and Ming Shi and Ness B. Shroff},
  journal= {arXiv preprint arXiv:2502.13457},
  year   = {2025}
}

备注

AAAI 2026