中文

呼吁明确报告BLEU分数

计算与语言 2018-09-13 v2

摘要

机器翻译领域面临一个未被充分认识到的问题,因其主导度量指标在分数报告上缺乏一致性。尽管人们提及“the” BLEU分数,但BLEU实际上是一个参数化度量,其值随这些参数的改变可能发生剧烈变化。这些参数常常未被报告或难以查找,因此论文之间的BLEU分数无法直接比较。我量化了这种变化,发现常用配置之间的差异高达1.8。主要原因在于应用于参考句的不同的分词与归一化方案。借鉴句法分析社区的成功经验,我建议机器翻译研究者采用机器翻译年会(WMT)所使用的BLEU方案,该方案不允许用户自定义的参考句处理,并提供了一个新工具SacreBLEU以促进此实践。

关键词

引用

@article{arxiv.1804.08771,
  title  = {A Call for Clarity in Reporting BLEU Scores},
  author = {Matt Post},
  journal= {arXiv preprint arXiv:1804.08771},
  year   = {2018}
}

备注

6 pages, 1 figure