代理数据何时可以改善偏好学习的样本复杂度?
机器学习
2024-12-24 v1 人工智能
机器学习
摘要
我们关注奖励被黑客攻击的问题,即最大化代理奖励并不一定增加真实奖励。这一问题对于大型语言模型(LLM)至关重要,因为它们通常会针对可能不准确反映真实目标的人类偏好进行微调。现有工作使用各种技巧,如正则化、对奖励模型的调整以及奖励被黑客攻击的检测器,来限制此类代理偏好对模型的影响。幸运的是,在医学、教育和法律等许多领域,通常可获得稀疏的专家数据。在这些情况下,是否可以将代理数据添加到策略学习中以提高学习效果尚不明了。我们概述了一组关于代理反馈的充分条件,如果满足这些条件,便表明代理数据可以以可证的方式提高学习真实策略的样本复杂度。这一结果意味着可以为 LLM 提供一种参数化,以实现此改进的样本复杂度。我们详细说明了如何调整现有架构以获得此改进的样本复杂度。
引用
@article{arxiv.2412.16475,
title = {When Can Proxies Improve the Sample Complexity of Preference Learning?},
author = {Yuchen Zhu and Daniel Augusto de Souza and Zhengyan Shi and Mengyue Yang and Pasquale Minervini and Alexander D'Amour and Matt J. Kusner},
journal= {arXiv preprint arXiv:2412.16475},
year = {2024}
}