中文

基于偏好的纯粹探索

机器学习 2025-01-20 v2 机器学习

摘要

我们研究了基于偏好的 bandits 纯粹探索问题,其奖励为向量型。奖励依据给定的偏好锥 C\mathcal{C} 进行排序,目标是识别最优的臂组。首先,推导了识别具有置信水平 1δ1-\delta 的最受偏好策略样本复杂度的新下界。该下界揭示了偏好锥几何在问题难度中的作用,与现有最佳臂识别变体的难度差异。我们进一步在奖励服从高斯分布时阐释了该几何。随后,我们对下界进行凸松弛,并据此设计了偏好式跟踪并停止(PreTS)算法,用于识别最受偏好策略。最后,我们通过推导新的向量奖励浓度不等式,表明 PreTS 的样本复杂度在渐近意义上是紧密的。

关键词

引用

@article{arxiv.2412.02988,
  title  = {Preference-based Pure Exploration},
  author = {Apurv Shukla and Debabrota Basu},
  journal= {arXiv preprint arXiv:2412.02988},
  year   = {2025}
}