中文

SLING:大语言模型的中文语言学评测

计算与语言 2022-10-24 v1

摘要

为理解预训练中文语言模型(LMs)编码了哪些语言知识,我们引入了中文语言学(SLING)基准,其包含 38K 个最小句子对,按 9 类高层语言现象分组于普通话中。每对展示某一特定句法或语义现象的可接受性对比(例如:The keys are lost 与 The keys is lost),语言模型应对可接受句子赋予更低困惑度。与同样包含中文最小对且由翻译英语 BLiMP 数据集词汇创建的 CLiMP 数据集(Xiang 等,2021)不同,SLING 中的最小对主要通过将句法与词汇变换应用于来自 Chinese Treebank 9.0 的自然出现、语言学家标注的句子而得到,从而解决了 CLiMP 数据生成过程中的严重问题。我们在 SLING 上测试了 18 个公开可用的预训练单语(如 BERT-base-zh、CPM)和多语(如 mT5、XLM)语言模型。实验表明,语言模型的平均准确率远低于人类表现(69.7% 对比 97.1%),而 BERT-base-zh 在所有被测语言模型(甚至包括大得多的模型)中准确率最高(84.8%)。此外,我们发现大多数语言模型具有强烈的性别和数(单数/复数)偏见,且在局部现象上的表现优于层级现象。

关键词

引用

@article{arxiv.2210.11689,
  title  = {SLING: Sino Linguistic Evaluation of Large Language Models},
  author = {Yixiao Song and Kalpesh Krishna and Rajesh Bhatt and Mohit Iyyer},
  journal= {arXiv preprint arXiv:2210.11689},
  year   = {2022}
}

备注

29 pages, EMNLP 2022 camera ready