中文

用于高效偏好数据选择与诊断的对齐数据图

计算与语言 2026-04-21 v3

摘要

人类偏好数据对于将大型语言模型(LLM)与人类价值观对齐至关重要,但收集此类数据通常成本高昂且效率低下,这促使我们需要高效的数据选择方法,以在保持对齐有效性的同时降低标注成本。为了解决这一问题,我们提出了 Alignment Data Map,一种用于识别和选择有效偏好数据的分析工具。我们首先通过 LLM-as-a-judge、显式奖励模型和基于参考的方法评估偏好数据的对齐分数。Alignment Data Map 基于对齐分数同时考虑响应质量和响应间变异性。我们的实验发现,仅使用 33% 表现出高质量和低变异性的样本进行训练,即可在 MT-Bench、Evol-Instruct 和 AlpacaEval 上取得与使用完整数据集训练相当或更优的对齐性能。此外,Alignment Data Map 通过分析标注标签与对齐分数之间的相关性来检测潜在的错误标注,从而提高标注准确性。实现代码可在 https://github.com/01choco/Alignment-Data-Map 获取。

关键词

引用

@article{arxiv.2505.23114,
  title  = {Alignment Data Map for Efficient Preference Data Selection and Diagnosis},
  author = {Seohyeong Lee and Eunwon Kim and Hwaran Lee and Buru Chang},
  journal= {arXiv preprint arXiv:2505.23114},
  year   = {2026}
}

备注

ACL 2026 Findings Camera-Ready