迈向多参考时代——解决NLG评估中的数据泄漏与参考多样性有限问题
计算与语言
2023-08-11 v4
摘要
基于n-gram匹配的评估指标,如BLEU和chrF,被广泛应用于一系列自然语言生成(NLG)任务中。然而,近期研究揭示这些基于匹配的指标与人类评估之间的相关性较弱,尤其是与基于神经网络的指标(如BLEURT)相比。在本文中,我们推测基于匹配的指标的性能瓶颈可能由参考的有限多样性引起。为解决此问题,我们提出利用\textit{多参考}来增强这些指标与人类评估的一致性。在WMT Metrics基准中,我们观察到多参考F200spBLEU相较传统单参考版本准确率提升7.2%。值得注意的是,它还以3.9%的准确率增益超越了基于神经网络的BERTscore。此外,我们观察到大语言模型(LLMs)中的数据泄漏问题可在很大程度上被我们的多参考指标缓解。我们在\url{https://github.com/SefaZeng/LLM-Ref}发布了代码与数据。
引用
@article{arxiv.2308.03131,
title = {Towards Multiple References Era -- Addressing Data Leakage and Limited Reference Diversity in NLG Evaluation},
author = {Xianfeng Zeng and Yijin Liu and Fandong Meng and Jie Zhou},
journal= {arXiv preprint arXiv:2308.03131},
year = {2023}
}
备注
Work in progress