MISMATCH:基于失配错误类型的机器生成文本细粒度评估
计算与语言
2023-06-21 v1
摘要
随着对大语言模型兴趣的增长,评估机器文本相对于参考文本(通常为人类生成)质量的需求已成为关注焦点。最近多数工作要么聚焦于特定任务的评估指标,要么研究现有指标所捕获的机器生成文本特性。在本工作中,我们提出一种新的评估方案,基于一对文本间细粒度的失配来建模 7 个 NLP 任务中的人类判断。受近期若干 NLP 任务中细粒度评估工作的启发,我们引入一组 13 种失配错误类型,如空间/地理错误、实体错误等,以引导模型更好地预测人类判断。我们提出一个评估机器文本的神经网络框架,将这些失配错误类型作为辅助任务,并将现有的单一数值评估指标重新用作附加标量特征,此外还有从机器和参考文本中提取的文本特征。我们的实验通过这些失配错误揭示了关于现有指标的关键见解。我们表明,来自 7 个 NLP 任务的留出数据集上句子对之间的失配错误与人类评估吻合良好。
引用
@article{arxiv.2306.10452,
title = {MISMATCH: Fine-grained Evaluation of Machine-generated Text with Mismatch Error Types},
author = {Keerthiram Murugesan and Sarathkrishna Swaminathan and Soham Dan and Subhajit Chaudhury and Chulaka Gunasekara and Maxwell Crouse and Diwakar Mahajan and Ibrahim Abdelaziz and Achille Fokoue and Pavan Kapanipathi and Salim Roukos and Alexander Gray},
journal= {arXiv preprint arXiv:2306.10452},
year = {2023}
}
备注
Accepted at ACL 2023 (ACL Findings Long)