迈向可解释的自然语言生成评测指标
计算与语言
2022-03-22 v1 机器学习
摘要
与 BLEU 等经典词汇重叠指标不同,当前大多数评测指标(如 BERTScore 或 MoverScore)基于 BERT 或 XLM-R 等黑盒语言模型。它们常能与人类判断达成强相关性,但近期研究表明低质量的经典指标仍占主导,潜在原因之一是它们的决策过程透明。为促进新颖高质量指标更广泛地被接受,可解释性由此变得关键。在这篇概念论文中,我们确定了可解释机器翻译评测指标的关键属性并提出了关键目标。我们还对近期可解释机器翻译指标的方法进行了综合概述,并讨论它们与这些目标和属性的关系。此外,我们进行了自己的新颖实验,其中(除其他外)发现当前对抗性 NLP 技术不适合自动识别高质量黑盒评测指标的局限性,因为它们不保持语义。最后,我们展望了未来可解释评测指标及其评估的方法。我们希望我们的工作能帮助催化并指导未来关于可解释评测指标的研究,并间接促进更好且更透明的文本生成系统。
引用
@article{arxiv.2203.11131,
title = {Towards Explainable Evaluation Metrics for Natural Language Generation},
author = {Christoph Leiter and Piyawat Lertvittayakumjorn and Marina Fomicheva and Wei Zhao and Yang Gao and Steffen Eger},
journal= {arXiv preprint arXiv:2203.11131},
year = {2022}
}