SMART:以句子为文本评估基本单元的度量方法
计算与语言
2022-08-02 v1
摘要
广泛使用的文本生成评估指标要么不能很好地处理较长文本,要么无法评估文本质量的各个方面。在本文中,我们引入了一种称为SMART的新指标来缓解此类局限。具体而言,我们将句子而非词元作为匹配的基本单元,并使用句子匹配函数对候选句与参考句进行软匹配。候选句还与源文档中的句子进行比较,以支持基础事实性(如真实性)评估。我们的结果表明,在SummEval摘要元评估数据集上,我们所提指标采用基于模型的匹配函数时,其系统级相关性优于所有竞争指标;而同一指标采用基于字符串的匹配函数时,与当前基于模型的指标相当。后者不使用任何神经模型,这在资源有限且需要快速评估的模型开发阶段非常有用。最后,我们还进行了广泛的分析,表明我们所提指标在较长摘要上表现良好,且对特定模型的偏向更小。
引用
@article{arxiv.2208.01030,
title = {SMART: Sentences as Basic Units for Text Evaluation},
author = {Reinald Kim Amplayo and Peter J. Liu and Yao Zhao and Shashi Narayan},
journal= {arXiv preprint arXiv:2208.01030},
year = {2022}
}
备注
code coming soon