中文

AIR:偏好数据集中标注、指令和响应对的系统分析

计算与语言 2025-09-03 v2

摘要

偏好学习对于将大型语言模型(LLM)与人类价值观对齐至关重要,但其成功取决于包含三个核心组件的高质量数据集:偏好标注、指令和响应对。当前的方法将这些组件混为一谈,掩盖了它们各自的影响并阻碍了系统性优化。在本工作中,我们提出了 AIR,一个按组件的分析框架,能够系统地隔离并优化每个组件,同时评估它们的协同效应。通过严格的实验,AIR 揭示了可操作的原则:标注简洁性(逐点生成式评分)、指令推断稳定性(跨 LLM 的基于方差的过滤)以及响应对质量(适中边距 + 高绝对分数)。当结合使用时,这些原则在基线方法上产生了 +5.3 的平均增益,即使仅使用 14k 个高质量对。我们的工作将偏好数据集设计从临时扩展转向组件感知优化,为高效、可复现的对齐提供了蓝图。

关键词

引用

@article{arxiv.2504.03612,
  title  = {AIR: A Systematic Analysis of Annotations, Instructions, and Response Pairs in Preference Dataset},
  author = {Bingxiang He and Wenbin Zhang and Jiaxi Song and Cheng Qian and Zixuan Fu and Bowen Sun and Ning Ding and Haiwen Hong and Longtao Huang and Hui Xue and Ganqu Cui and Wanxiang Che and Zhiyuan Liu and Maosong Sun},
  journal= {arXiv preprint arXiv:2504.03612},
  year   = {2025}
}

备注

Accept at the Conference On Language Modeling (COLM) 2025