SLMEval:基于熵的大语言模型人类对齐评估校准方法
计算与语言
2025-05-23 v1 人工智能
摘要
LLM 评判范式提供了一种可扩展、无需参考资料的评估语言模型的方法。尽管已提出多种校准技术以更好地将评估器与人类判断对齐,但先前研究主要集中在狭窄、结构良好的基准测试上,因而尚不清楚此类校准是否推广到真实世界、开放性任务。本文我们展示,最先进的校准评估器在此类场景下常常失败,表现出与人类判断的弱相关甚至负相关。为此,我们提出 SLMEval,一种基于熵最大化的新型高效校准方法,利用少量人类偏好数据。通过对模型质量的潜在分布进行估计并相应重新加权评估器分数,SLMEval 在两个真实世界生产用例和公共基准测试中均实现了与人类评估的强相关性。例如,在该任务上,SLMEval 与人类判断的斯皯曼相关系数为 0.57,而 G-Eval 结果为负相关。此外,SLMEval 相较于基于 GPT-4 的校准评估器(如 G-eval)可降低 5-30 倍的评估成本。
引用
@article{arxiv.2505.16003,
title = {SLMEval: Entropy-Based Calibration for Human-Aligned Evaluation of Large Language Models},
author = {Roland Daynauth and Christopher Clarke and Krisztian Flautner and Lingjia Tang and Jason Mars},
journal= {arXiv preprint arXiv:2505.16003},
year = {2025}
}