中文

如何不在基准测试中说谎:重排NLP排行榜

计算与语言 2021-12-03 v1 人工智能

摘要

与人类进行比较是基准测试作为模型能力可靠度量的基本要求。然而,模型比较的方法可能存在根本缺陷——对不同复杂度、不同测试与训练集规模的各项任务,均使用单独指标的算术平均。本文考察了流行NLP基准的整体计分方法,并根据其报告结果以几何平均与调和平均(适用于平均比率)对模型重新排序。我们分析了包括GLUE、SuperGLUE、XGLUE与XTREME在内的若干流行基准。分析表明,例如SuperGLUE上尚未达到人类水平,且当前模型仍有改进空间。

关键词

引用

@article{arxiv.2112.01342,
  title  = {How not to Lie with a Benchmark: Rearranging NLP Leaderboards},
  author = {Shavrina Tatiana and Malykh Valentin},
  journal= {arXiv preprint arXiv:2112.01342},
  year   = {2021}
}

备注

Accepted to ICBINB Workshop, NeurIPS 2021