中文

迈向多参考时代——解决NLG评估中的数据泄漏与参考多样性有限问题

计算与语言 2023-08-11 v4

摘要

基于n-gram匹配的评估指标,如BLEU和chrF,被广泛应用于一系列自然语言生成(NLG)任务中。然而,近期研究揭示这些基于匹配的指标与人类评估之间的相关性较弱,尤其是与基于神经网络的指标(如BLEURT)相比。在本文中,我们推测基于匹配的指标的性能瓶颈可能由参考的有限多样性引起。为解决此问题,我们提出利用\textit{多参考}来增强这些指标与人类评估的一致性。在WMT Metrics基准中,我们观察到多参考F200spBLEU相较传统单参考版本准确率提升7.2%。值得注意的是,它还以3.9%的准确率增益超越了基于神经网络的BERTscore。此外,我们观察到大语言模型(LLMs)中的数据泄漏问题可在很大程度上被我们的多参考指标缓解。我们在\url{https://github.com/SefaZeng/LLM-Ref}发布了代码与数据。

关键词

引用

@article{arxiv.2308.03131,
  title  = {Towards Multiple References Era -- Addressing Data Leakage and Limited Reference Diversity in NLG Evaluation},
  author = {Xianfeng Zeng and Yijin Liu and Fandong Meng and Jie Zhou},
  journal= {arXiv preprint arXiv:2308.03131},
  year   = {2023}
}

备注

Work in progress