JCoLA:日语语言可接受性语料库
计算与语言
2023-09-25 v1
摘要
神经语言模型在一系列下游任务中表现出卓越性能。然而,关于这些模型在多大程度上内化了句法知识,人们的理解仍然有限,因此近来已构建多种数据集以促进跨语言语言模型的句法评估。本文中,我们介绍JCoLA(Japanese Corpus of Linguistic Acceptability,日语语言可接受性语料库),其由10,020个标注了二元可接受性判断的句子组成。具体而言,这些句子从语言学教材、手册和期刊文章中人工提取,并划分为域内数据(86%;从教材和手册中提取的相对简单的可接受性判断)和域外数据(14%;从期刊文章中提取的具有理论重要性的可接受性判断),后者按12种语言现象分类。随后,我们在JCoLA上评估了9种不同类型日语语言模型的句法知识。结果表明,若干模型在域内数据上可超越人类表现,但没有任何模型能在域外数据上超过人类表现。按语言现象进行的错误分析进一步揭示,尽管神经语言模型善于处理如论元结构之类的局部句法依存,但在面对如动词一致和NPI允准等长距离句法依存时,其表现会减弱。
引用
@article{arxiv.2309.12676,
title = {JCoLA: Japanese Corpus of Linguistic Acceptability},
author = {Taiga Someya and Yushi Sugimoto and Yohei Oseki},
journal= {arXiv preprint arXiv:2309.12676},
year = {2023}
}