中文

自然语言处理中用于衡量性能的指标的全局分析

计算与语言 2022-04-26 v1 人工智能

摘要

衡量自然语言处理模型的性能具有挑战性。传统使用的指标,如 BLEU 和 ROUGE,最初为机器翻译和摘要任务设计,已被证明与人类判断的相关性较低,且缺乏向其他任务和语言的迁移能力。在过去15年中,人们提出了大量替代指标。然而,目前尚不清楚这在多大程度上影响了 NLP 基准测试工作。本文首次对自然语言处理中用于衡量性能的指标进行了大规模横断面分析。我们整理、映射并系统化了来自开放仓库“Papers with Code”的超过3500个机器学习模型性能结果,以实现全局且全面的分析。我们的结果表明,当前使用的绝大多数自然语言处理指标具有可能导致对模型性能反映不充分的性质。此外,我们发现指标报告中的模糊性与不一致性可能导致解释和比较模型性能的困难,损害了 NLP 研究的透明性与可复现性。

关键词

引用

@article{arxiv.2204.11574,
  title  = {A global analysis of metrics used for measuring performance in natural language processing},
  author = {Kathrin Blagec and Georg Dorffner and Milad Moradi and Simon Ott and Matthias Samwald},
  journal= {arXiv preprint arXiv:2204.11574},
  year   = {2022}
}

备注

"NLP Power" workshop at ACL 2022. This work is based on a previous arXiv submission: arXiv:2008.02577 [cs.AI]