如何不在基准测试中说谎:重排NLP排行榜
计算与语言
2021-12-03 v1 人工智能
摘要
与人类进行比较是基准测试作为模型能力可靠度量的基本要求。然而,模型比较的方法可能存在根本缺陷——对不同复杂度、不同测试与训练集规模的各项任务,均使用单独指标的算术平均。本文考察了流行NLP基准的整体计分方法,并根据其报告结果以几何平均与调和平均(适用于平均比率)对模型重新排序。我们分析了包括GLUE、SuperGLUE、XGLUE与XTREME在内的若干流行基准。分析表明,例如SuperGLUE上尚未达到人类水平,且当前模型仍有改进空间。
引用
@article{arxiv.2112.01342,
title = {How not to Lie with a Benchmark: Rearranging NLP Leaderboards},
author = {Shavrina Tatiana and Malykh Valentin},
journal= {arXiv preprint arXiv:2112.01342},
year = {2021}
}
备注
Accepted to ICBINB Workshop, NeurIPS 2021