中文

从排序到排序:基于随机弗雷明的主动人类偏好学习

机器学习 2024-12-30 v1 人工智能 信息论 math.IT 最优化与控制 机器学习

摘要

我们研究从有限比较反馈中学习人类偏好的问题。这是机器学习中常见的任务,其应用如从人类反馈中获得强化学习具有变革性。我们将此问题建模为从K向比较反馈中对N个选择构建Plackett-Luce模型,其中通常K << N。我们的解决方案是Plackett-Luce目标的D-最优设计。该设计定义了一个数据记录策略,用于从所有(NK){N \choose K}可行子集中精选一小组最佳点以获取比较反馈。本工作的主要算法挑战在于,即使是快速的方法对于D-最优设计也具有O((NK){N \choose K})时间复杂度。为此,我们提出了一种随机弗雷明(FW)算法,该算法在随机选择的变量上求解线性最大化子问题。我们对该算法进行了分析,并在合成数据和开源NLP数据集上进行了实证评估。

关键词

引用

@article{arxiv.2412.19396,
  title  = {Comparing Few to Rank Many: Active Human Preference Learning using Randomized Frank-Wolfe},
  author = {Kiran Koshy Thekumparampil and Gaurush Hiranandani and Kousha Kalantari and Shoham Sabach and Branislav Kveton},
  journal= {arXiv preprint arXiv:2412.19396},
  year   = {2024}
}

备注

Submitted to AISTATS 2025 on October 10, 2024