基于规则的启发式方法在解决俄语SuperGLUE任务中出奇有效
计算与语言
2021-05-05 v1
摘要
像SuperGLUE这样的排行榜被视为推动NLP积极发展的重要激励,因为它们为现代语言模型的公平比较提供了标准基准。它们促使全球顶尖工程团队及其资源协作解决一系列通用语言理解任务。其性能分数常被宣称接近甚至高于人类表现。这些结果引发了对基准数据集是否包含基于机器学习的语言模型可利用的统计线索的更细致分析。对于英语数据集,已有研究表明它们常含有标注伪迹,使得用非常简单的规则即可解决某些任务并取得有竞争力的排名。本文对近期发布的俄语自然语言理解基准与排行榜——俄语SuperGLUE(RSG)做了类似分析。我们表明其测试数据集易受浅层启发式攻击;基于简单规则的方法常能超越或接近GPT-3、BERT等知名预训练语言模型的结果。最可能的解释(作为最简说明)是:RSG排行榜中SOTA模型的相当一部分性能来自利用这些浅层启发式,而与真实语言理解毫无关系。我们给出一组如何改进这些数据集的建议,使RSG排行榜更能代表俄语NLU的真实进展。
引用
@article{arxiv.2105.01192,
title = {Unreasonable Effectiveness of Rule-Based Heuristics in Solving Russian SuperGLUE Tasks},
author = {Tatyana Iazykova and Denis Kapelyushnik and Olga Bystrova and Andrey Kutuzov},
journal= {arXiv preprint arXiv:2105.01192},
year = {2021}
}
备注
Accepted to Dialogue'2021