中文

BLEU 邻居:一种无参考的自动评估方法

计算与语言 2020-10-14 v3 机器学习

摘要

评估是自然语言生成(NLG)模型开发中的瓶颈。诸如 BLEU 之类的自动指标依赖于参考文本,但对于开放式生成等任务,没有可参考的文本。尽管可以使用困惑度等统计度量来估计语言多样性,但衡量语言质量需要人工评估。然而,由于大规模人工评估缓慢且昂贵,其使用十分有限;它不能像 BLEU 用于机器翻译那样用于快速迭代 NLG 模型。为此,我们提出 BLEU 邻居,一种通过使用 BLEU 分数作为核函数的近邻模型来估计语言质量。在现有的闲聊对话和开放式句子生成数据集上,我们发现——平均而言——BLEU 邻居模型的质量估计比单个人类标注者与真实值的均方误差更低、斯皮尔曼相关性更高。尽管简单,BLEU 邻居甚至在自动评分作文上优于最先进模型,包括那些能获取黄金标准参考作文的模型。

关键词

引用

@article{arxiv.2004.12726,
  title  = {BLEU Neighbors: A Reference-less Approach to Automatic Evaluation},
  author = {Kawin Ethayarajh and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2004.12726},
  year   = {2020}
}