中文

句子级聚合的词汇指标与人类判断更强相关于语料库级聚合

计算与语言 2025-01-24 v2

摘要

本文我们展示了语料库级聚合显著阻碍了词汇指标准确评估机器翻译系统的能力。通过实证实验,我们证明对单个片段水平得分进行平均可以使诸如 BLEU 和 chrF 等指标与人类判断之间相关性更强,并且使其在行为上与神经网络指标如 COMET 和 BLEURT 更为相似。我们展示了这种差异之所以存在是因为语料库级聚合和片段级聚合在很大程度上存在差异,这源于“平均比率”与“比率平均”之间的经典数学问题。此外,我们也展示了这种差异显著影响语料库级聚合的统计鲁棒性。考虑到神经指标目前仅覆盖少数足够资源的语言,该论文中的结果可以帮助更可信地评估低资源语言的机器翻译系统。

关键词

引用

@article{arxiv.2407.12832,
  title  = {Sentence-level Aggregation of Lexical Metrics Correlates Stronger with Human Judgements than Corpus-level Aggregation},
  author = {Paulo Cavalin and Pedro Henrique Domingues and Claudio Pinhanez},
  journal= {arXiv preprint arXiv:2407.12832},
  year   = {2025}
}

备注

corrected typo on title