基于神经情境斗争型多臂赌博机的主动人类反馈收集
机器学习
2025-07-18 v2
摘要
收集人类偏好反馈往往昂贵,导致最近的研究开发了原则化的算法来更有效地选择它们。然而,这些工作假设底层奖励函数是线性的,这在许多现实场景中并不成立,例如在线推荐和大语言模型对齐方面。为此,我们提出了Neural-ADB算法,基于神经情境斗争型多臂赌博机框架,为底层潜在奖励函数为非线性时收集人类偏好反馈提供一种原则且实用的方法。我们理论地表明,当偏好反馈遵循Bradley-Terry-Luce模型时,Neural-ADB学习的策略的最坏次优itivity间隙随偏好数据集的增加以亚线性速率递减。我们的实验结果在偏好数据集上进一步证实了Neural-ADB的有效性。
引用
@article{arxiv.2504.12016,
title = {Active Human Feedback Collection via Neural Contextual Dueling Bandits},
author = {Arun Verma and Xiaoqiang Lin and Zhongxiang Dai and Daniela Rus and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2504.12016},
year = {2025}
}
备注
19 pages