中文

BLEURT:学习用于文本生成的鲁棒度量指标

计算与语言 2020-05-22 v5

摘要

近年来,文本生成取得了显著进展。然而,评估指标的发展相对滞后,因为最流行的选择(如 BLEU 和 ROUGE)可能与人类判断的相关性较差。我们提出了 BLEURT,一种基于 BERT 的习得评估指标,能够利用数千个可能带有偏差的训练样本对人类判断进行建模。我们方法的一个关键方面是一种新颖的预训练方案,该方案使用数百万个合成样本来帮助模型泛化。BLEURT 在最近三年的 WMT Metrics 共享任务和 WebNLG Competition 数据集上提供了最先进的结果。与纯粹的基于 BERT 的方法相比,即使在训练数据稀缺且分布外的情况下,它也能产生更优的结果。

关键词

引用

@article{arxiv.2004.04696,
  title  = {BLEURT: Learning Robust Metrics for Text Generation},
  author = {Thibault Sellam and Dipanjan Das and Ankur P. Parikh},
  journal= {arXiv preprint arXiv:2004.04696},
  year   = {2020}
}

备注

Accepted at ACL 2020