中文

ELSPR:基于锦标图重构的评估器 LLM 训练数据自我净化(非传递偏好)

计算与语言 2025-12-03 v3

摘要

大语言模型(LLM)的两两评估已成为衡量开放性任务的主导范式,但非传递偏好(即评估器偏好 A 大于 B,B 大于 C,但 C 大于 A)从根本上削弱了排序的可靠性。我们指出,这一关键问题主要源于低质量数据,其中包含本质上模糊的偏好对。为解决这一挑战,我们提出 ELSPR 框架,采用图论方法将两两偏好建模为锦标图,并系统性地识别有问题的训练数据。ELSPR 通过强连通分量(SCCs)分析量化非传递性,并通过一种新颖的归一化有向图结构熵指标衡量整体偏好清晰度。我们的过滤方法有选择地移除导致非传递性的偏好数据,同时保留传递偏好。在 AlpacaEval 基准上的大量实验表明,基于 ELSPR 过滤数据微调的模型实现了显著改进:非传递性降低 13.8%,结构熵降低 0.088,并在实际评估系统中显著增强了判别能力。人类验证确认,被丢弃的数据在跨评注者一致性(34.4% vs 52.6%)和模型-人类一致性(51.2% vs 80.6%)方面显著低于清理后的数据。这些发现将 ELSPR 确立为开发更可靠、更一致且更贴近人类直觉的 LLM 评估系统的有效数据自我净化方法。

关键词

引用

@article{arxiv.2505.17691,
  title  = {ELSPR: Evaluator LLM Training Data Self-Purification on Non-Transitive Preferences via Tournament Graph Reconstruction},
  author = {Yan Yu and Yilun Liu and Minggui He and Shimin Tao and Weibin Meng and Xinhua Yang and Li Zhang and Hongxia Ma and Dengye Li and Daimeng Wei and Boxing Chen and Fuliang Li},
  journal= {arXiv preprint arXiv:2505.17691},
  year   = {2025}
}

备注

Accepted by AAAI 2026