通过沿语言因素解耦实现基于 BERT 的评估指标的全局可解释性
计算与语言
2021-11-02 v2
摘要
评估指标是文本生成系统取得进展的关键要素。近年来,提出了若干基于 BERT 的评估指标(包括 BERTScore、MoverScore、BLEURT 等),它们与人类对文本生成质量的评估相关性远好于二十年前发明的 BLEU 或 ROUGE。然而,这些基于黑盒语言模型表示的指标究竟捕捉了什么,人们知之甚少(通常假定它们建模语义相似度)。在这项工作中,我们使用一种简单的基于回归的全局可解释性技术,沿语言因素(包括语义、句法、形态和词汇重叠)解耦指标分数。我们表明,不同指标在某种程度上捕捉了所有方面,但它们都像 BLEU 和 ROUGE 一样对词汇重叠相当敏感。这暴露了这些新提出指标的局限性,我们也在对抗性测试场景中予以突显。
引用
@article{arxiv.2110.04399,
title = {Global Explainability of BERT-Based Evaluation Metrics by Disentangling along Linguistic Factors},
author = {Marvin Kaster and Wei Zhao and Steffen Eger},
journal= {arXiv preprint arXiv:2110.04399},
year = {2021}
}
备注
EMNLP2021 Camera Ready