ContrastScore:基于对比评估迈向更高质量、更少偏见且更高效的评估指标
计算与语言
2025-11-25 v3
摘要
自动评估生成文本的质量仍然是一个重大挑战。已证明传统的基于参考的指标与人工评估的相关性较弱。最近的研究提倡使用大型语言模型(LLM)作为基于源的指标来评估自然语言生成(NLG)。尽管前景广阔,但基于 LLM 的指标,特别是那些使用较小模型的指标,在与人类判断对齐方面仍有不足。在本工作中,我们引入了 ContrastScore,这是一种对比评估指标,旨在对生成文本实现更高质量、更少偏见且更高效的评估。我们在两个 NLG 任务上评估了 ContrastScore:机器翻译和摘要。实验结果表明,与单模型和基于集成的基线相比,ContrastScore 始终取得与人类判断更强的相关性。值得注意的是,基于 Qwen 3B 和 0.5B 的 ContrastScore 甚至优于 Qwen 7B,尽管其参数量仅为一半,这展示了其高效性。此外,它有效缓解了长度和似然偏好等常见评估偏差,从而实现更鲁棒的自动评估。
引用
@article{arxiv.2504.02106,
title = {ContrastScore: Towards Higher Quality, Less Biased, More Efficient Evaluation Metrics with Contrastive Evaluation},
author = {Xiao Wang and Daniil Larionov and Siwei Wu and Yiqi Liu and Steffen Eger and Nafise Sadat Moosavi and Chenghua Lin},
journal= {arXiv preprint arXiv:2504.02106},
year = {2025}
}
备注
Accepted at AACL 2025 (Main Conference Paper)