中文

基于模型的文本生成评估指标的盲点

计算与语言 2023-05-22 v3

摘要

在本工作中,我们探索了一种有用但常被忽视的文本生成评估指标鲁棒性分析方法:使用合成数据的压力测试。基本上,我们设计并合成了一系列潜在错误,并检查它们是否导致指标分数相应下降。我们考察了近期提出的基于预训练语言模型的多种评估指标,涉及开放生成、翻译和摘要任务。我们的实验揭示了现有指标中有趣的不敏感性、偏差甚至漏洞。例如,我们发现BERTScore在摘要中被截断错误所迷惑,而MAUVE(构建于GPT-2之上)对生成开头或中间的错误不敏感。进一步,我们探究了这些盲点背后的原因,并给出了更可靠评估文本生成的实用应对方法。我们已在https://github.com/cloudygoose/blindspot_nlg发布了代码和数据。

关键词

引用

@article{arxiv.2212.10020,
  title  = {On the Blind Spots of Model-Based Evaluation Metrics for Text Generation},
  author = {Tianxing He and Jingyu Zhang and Tianle Wang and Sachin Kumar and Kyunghyun Cho and James Glass and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2212.10020},
  year   = {2023}
}

备注

ACL 2023