并非所有指标皆有罪:通过丰富参考文本改进自然语言生成评估
计算与语言
2024-05-28 v3
摘要
大多数关于自然语言生成(NLG)的研究依赖于对每个样本仅有有限参考文本的评估基准,这可能导致与人类判断的相关性较差。其根本原因在于,同一语义实际可用不同形式表达,而基于单一或少量参考的评估可能无法准确反映模型假设的质量。为解决此问题,本文提出一种简单有效的方法,名为 Div-Ref,通过扩充参考文本数量来增强现有评估基准。我们利用大型语言模型(LLM)将单一参考文本多样化为多个高质量参考,以尽可能覆盖参考句子的语义空间。我们开展全面实验,经验性地证明丰富参考文本的表达可显著增强自动评估与人类评估间的相关性。该思路与近期基于 LLM 的评估相兼容,后者同样可从引入多个参考中获益。我们强烈鼓励未来的生成基准纳入更多参考文本,即便由 LLM 生成亦如此,此乃一劳永逸之举。我们在 https://github.com/RUCAIBox/Div-Ref 发布所有代码与数据以促进研究。
引用
@article{arxiv.2305.15067,
title = {Not All Metrics Are Guilty: Improving NLG Evaluation by Diversifying References},
author = {Tianyi Tang and Hongyuan Lu and Yuchen Eleanor Jiang and Haoyang Huang and Dongdong Zhang and Wayne Xin Zhao and Tom Kocmi and Furu Wei},
journal= {arXiv preprint arXiv:2305.15067},
year = {2024}
}
备注
Accepted by NAACL 2024