SESCORE2:通过合成逼真错误学习文本生成评估
计算与语言
2023-07-10 v2
摘要
能否在没有人工标注评分的情况下,训练一个用于评估文本生成质量的通用指标?现有的学习型指标要么在跨文本生成任务上表现不佳,要么需要针对特定任务的人工评分进行训练。在本文中,我们提出了SESCORE2,这是一种用于训练基于模型的文本生成评估指标的自监督方法。其核心概念是通过扰动从语料库中检索到的句子来合成逼真的模型错误。SESCORE2的主要优势在于易于扩展到许多其他语言,同时提供可靠的严重性估计。我们在三种语言的四个文本生成任务上评估了SESCORE2和先前的方法。在四个文本生成评估基准上,SESCORE2优于无监督指标PRISM,Kendall系数提升了0.078。令人惊讶的是,SESCORE2在多个文本生成任务上甚至优于有监督的BLEURT和COMET。代码和数据可在https://github.com/xu1998hz/SEScore2获取。
引用
@article{arxiv.2212.09305,
title = {SESCORE2: Learning Text Generation Evaluation via Synthesizing Realistic Mistakes},
author = {Wenda Xu and Xian Qian and Mingxuan Wang and Lei Li and William Yang Wang},
journal= {arXiv preprint arXiv:2212.09305},
year = {2023}
}
备注
Accepted at ACL2023 Main Conference