中文

探索大语言模型对齐中有价值偏好数据的特性

机器学习 2026-03-17 v2

摘要

大型语言模型(LLM)对齐通常通过学习人类偏好比较来实现,因此偏好数据的质量对其成功至关重要。现有研究 often 对原始训练数据集进行预处理,以使用外部奖励模型或现成 LLM 来识别有价值的偏好对,实现了 improved 的整体性能,但很少检查单个选定数据点是否真正有益。我们通过对验证数据进行 individual influence 分析来评估数据质量,采用我们新提出的截断影响函数(TIF),该方法缓解了传统度量中存在的 over-scoring,揭示了偏好数据质量本质上是模型属性。在其他 words,一个对某一模型有益的数据对可能对另一模型产生 harm。这使得改进偏好数据选择方法的需求变为适应具体模型。为此,我们引入两种候选评分函数(SFs),其计算复杂度低于 TIF且与之呈正相关。它们也是 model dependent 的,可作为偏好数据选择中 individual data quality 的潜在指示器。此外,我们观察到这些 SFs 在与 TIF 比较时本质上具有 error。为此,我们将其组合以抵消其多样化的 error 来源, resulting in 一个简单而有效的数据选择规则,使模型能够更精确地选择有价值的偏好数据。我们在多样化的对齐基准和各种 LLM 家族上进行实验,结果表明使用更少的数据即可实现更好的对齐性能,显示我们的发现和新方法的普适性。我们的 code 公开于 https://github.com/tmlr-group/TIF_LossDiff-IRM。

关键词

引用

@article{arxiv.2510.13212,
  title  = {Towards Understanding Valuable Preference Data for Large Language Model Alignment},
  author = {Zizhuo Zhang and Qizhou Wang and Shanshan Ye and Jianing Zhu and Jiangchao Yao and Bo Han and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2510.13212},
  year   = {2026}
}

备注

Accepted by ICLR 2026