中文

T5Score:生成式评估指标的判别性微调

计算与语言 2022-12-13 v1

摘要

现代基于嵌入的生成文本评估指标通常属于两种范式之一:判别性指标,经训练以根据有监督的人类标注直接预测哪些输出质量更高;以及生成式指标,经训练基于生成模型的概率评估文本。二者各有优势:判别性指标能够直接针对区分优劣输出的问题进行优化,而生成式指标可利用丰富的原始文本进行训练。本文提出一个结合两者优点的框架,充分利用现有数据中的有监督与无监督信号。我们通过训练 T5Score 来实现这一思路,该指标以 mT5 为骨干并使用这些训练信号。我们在 5 个数据集、19 种语言和 280 个系统上与其他现有指标进行了广泛的实证比较,展示了本方法的实用性。实验结果表明:在段落层面,T5Score 在所有数据集上相对于现有最高分指标均取得最佳性能。我们在 https://github.com/qinyiwei/T5Score 发布了代码与模型。

关键词

引用

@article{arxiv.2212.05726,
  title  = {T5Score: Discriminative Fine-tuning of Generative Evaluation Metrics},
  author = {Yiwei Qin and Weizhe Yuan and Graham Neubig and Pengfei Liu},
  journal= {arXiv preprint arXiv:2212.05726},
  year   = {2022}
}