透过偏好审视:解析用于对齐大语言模型的反馈获取
机器学习
2024-02-07 v3 人工智能
计算与语言
摘要
将大语言模型(LLMs)与人类价值观和意图对齐,关键涉及使用人类或 AI 反馈。虽然稠密反馈标注的获取与整合成本高昂,稀疏反馈在结构设计上面临评分(例如,以 1-7 分评价回复 A)与排序(例如,回复 A 是否优于回复 B?)之间的选择。本文中,我们分析这一设计选择对 LLM 对齐与评估的影响。我们揭示了一个不一致问题:由评分与排序推断出的偏好在人类与 AI 标注者中均有约 60% 显著分歧。我们随后的分析识别出解释该现象的标注者偏差的多个方面,例如人类标注者会对更稠密的回复打出更高分,而在成对判断时偏好准确性。令我们惊讶的是,我们还观察到反馈协议的选择对对齐后 LLM 的评估也有显著影响。具体而言,我们发现利用排序数据对齐的 LLM(设为模型 X)在基于排序的评估协议(X/Y 的回复是否优于参考回复?)下优于利用评分数据对齐的 LLM(设为模型 Y),但在基于评分的评估协议(以 1-7 分评价 X/Y 的回复)下并非如此。因此,我们的发现揭示了评估语言模型实际效用的方法中存在的关键鸿沟,及其对用于对齐的反馈协议的强烈依赖。我们的代码与数据见 https://github.com/Hritikbansal/sparse_feedback。
引用
@article{arxiv.2308.15812,
title = {Peering Through Preferences: Unraveling Feedback Acquisition for Aligning Large Language Models},
author = {Hritik Bansal and John Dang and Aditya Grover},
journal= {arXiv preprint arXiv:2308.15812},
year = {2024}
}
备注
31 pages, Accepted to ICLR 2024