当今 NLU 中超人类性能意味着什么?
计算与语言
2023-05-16 v1 人工智能
摘要
过去五年,自然语言处理(NLP)高度聚焦于开发更大的预训练语言模型(PLMs),并引入 SuperGLUE 与 SQuAD 等基准以衡量其在语言理解、推理与阅读理解上的能力。这些 PLM 在基准上取得了令人瞩目的结果,某些情况下甚至超越人类表现。这引发了超人类能力的宣称,以及某些任务已被解决的争议性观点。在本立场论文中,我们批判性地审视这些宣称,并追问 PLM 是否真正具备超人类能力,以及当前基准究竟在评估什么。我们表明这些基准存在严重影响人类与 PLM 比较的局限,并为更公平、更透明的基准提供建议。
引用
@article{arxiv.2305.08414,
title = {What's the Meaning of Superhuman Performance in Today's NLU?},
author = {Simone Tedeschi and Johan Bos and Thierry Declerck and Jan Hajic and Daniel Hershcovich and Eduard H. Hovy and Alexander Koller and Simon Krek and Steven Schockaert and Rico Sennrich and Ekaterina Shutova and Roberto Navigli},
journal= {arXiv preprint arXiv:2305.08414},
year = {2023}
}
备注
9 pages, long paper at ACL 2023 proceedings