中文

停止依赖无选项设定并避免重复选择:用于组合优化的最优、高效且实用算法

机器学习 2024-03-01 v1 信息检索

摘要

我们研究了带有偏好反馈的主动在线组合优化问题,这是一种建模用户选择和子集效用最大化的框架。该框架在广告投放、在线零售、推荐系统、语言模型微调等众多现实世界应用中非常有用。尽管该问题过去已被研究,但缺乏一种直观且实用的解决方案,能够同时具备高效算法和最优遗憾保证。例如,常用的组合选择算法通常要求存在一个总是包含在选项集中的“强参考项”,此外它们还被设计为重复提供相同的组合直到参考项被选中——所有这些要求对于实际应用来说都相当不切实际。在本文中,我们为基于\emph{Plackett Luce} (PL) 用户选择的组合选择中的遗憾最小化问题设计了高效算法。我们设计了一种新的集中性保证,用于通过"\emph{Pairwise Rank-Breaking}"估计 PL 模型的得分参数,这构成了我们提出算法的基础。此外,我们的方法实用、可证明是最优的,并且避免了现有方法的上述局限性。实证评估证实了我们的发现,并优于现有的基线方法。

关键词

引用

@article{arxiv.2402.18917,
  title  = {Stop Relying on No-Choice and Do not Repeat the Moves: Optimal, Efficient and Practical Algorithms for Assortment Optimization},
  author = {Aadirupa Saha and Pierre Gaillard},
  journal= {arXiv preprint arXiv:2402.18917},
  year   = {2024}
}