中文

双维排行榜:生成与评估携手并进

计算与语言 2022-05-20 v2

摘要

自然语言处理研究者已经认识到生成任务评估方法的局限性,并对自动指标和众包工作者判断的有效性提出了新的质疑。与此同时,改进生成模型的努力往往依赖于简单的 n-gram 重叠指标(例如 BLEU、ROUGE)。我们认为,模型和指标的新进展应该更直接地相互受益和启发。因此,我们提出了一种排行榜的推广形式,即双维排行榜(Billboards),它同时追踪语言生成模型及其评估指标的进展。与传统的单维排行榜按预定指标对提交的系统进行排序不同,Billboard 同时接受生成器和评估指标作为竞争条目。Billboard 自动创建一个集成指标,该指标基于对生成器的全局分析,选择并线性组合少数几个指标。此外,指标根据其与人类判断的相关性进行排名。我们发布了四个用于机器翻译、文本摘要和图像描述的双维排行榜。我们证明,由少数几个多样化指标组成的线性集成有时会显著优于单独使用的现有指标。我们的混合效应模型分析表明,大多数自动指标,尤其是基于参考的指标,会高估机器生成文本而低估人类生成文本,这证明了随着未来生成模型变得更强大(并且可能更类似于人类),更新指标的重要性。我们的项目网站可在 https://nlp.cs.washington.edu/billboard/ 获取。

关键词

引用

@article{arxiv.2112.04139,
  title  = {Bidimensional Leaderboards: Generate and Evaluate Language Hand in Hand},
  author = {Jungo Kasai and Keisuke Sakaguchi and Ronan Le Bras and Lavinia Dunagan and Jacob Morrison and Alexander R. Fabbri and Yejin Choi and Noah A. Smith},
  journal= {arXiv preprint arXiv:2112.04139},
  year   = {2022}
}

备注

Proc. of NAACL 2022