CURATRON:用于大语言模型严格对齐的完整且鲁棒的偏好数据
人工智能
2025-10-30 v3 计算与语言
摘要
本文解决了通过偏好学习(PL)将大语言模型(LLMs)与人类价值观对齐的挑战,重点关注偏好数据集中不完整和损坏的数据问题。我们提出了一种新颖的方法,用于鲁棒且完整地重新校准这些数据集内的价值观,以增强 LLMs 对这些问题的抵御能力。特别是,我们设计了一种保证多项式时间的排序算法,使几种现有模型(如经典的 Bradley-Terry-Luce (BTL) (Bradley and Terry, 1952) 模型及其某些泛化)具有鲁棒性。据我们所知,我们的工作首次提出了一种算法,该算法能以高概率证明恢复-最优排序,同时允许每个模型响应有多达个扰动的成对比较结果。此外,我们展示了在部分观测设置下的鲁棒恢复结果。我们的实验证实,我们的算法在通用和 LLM 偏好数据集设置中都能很好地处理对抗性噪声和未观测到的比较。这项工作通过赋予数据集整理管道处理缺失和恶意操纵输入的能力,促进了更可靠且符合伦理的 AI 模型的开发和扩展。
引用
@article{arxiv.2403.02745,
title = {CURATRON: Complete and Robust Preference Data for Rigorous Alignment of Large Language Models},
author = {Son The Nguyen and Niranjan Uma Naresh and Theja Tulabandhula},
journal= {arXiv preprint arXiv:2403.02745},
year = {2025}
}