Vyākarana:面向印度语言的句法评估无色绿色基准
计算与语言
2021-10-05 v3
摘要
尽管印度语言的自然语言理解(NLU)资源开发已取得显著进展,句法评估仍相对少被探索。与英语不同,印度语言具有丰富的形态句法、语法性、自由线性词序和高度屈折形态。本文引入Vyākarana:一个用于多语言模型句法评估的印度语言无色绿色句子基准。该基准包含四项句法相关任务:词性标注、句法树深度预测、语法格标记和主谓一致。我们利用评估任务的数据集探查五种不同架构的多语言模型在印度语言中的句法能力。鉴于其普遍性,我们还在实验中加入了语码转换设置。结果表明,来自印度语言模型(IndicBERT和MuRIL)的token级与句子级表征并未像其他高度多语言模型那样高效地捕捉印度语言句法。此外,我们的逐层探查实验揭示,尽管mBERT、DistilmBERT和XLM-R将句法定位在中层,印度语言模型并未表现出此类句法定位。
引用
@article{arxiv.2103.00854,
title = {Vy\=akarana: A Colorless Green Benchmark for Syntactic Evaluation in Indic Languages},
author = {Rajaswa Patil and Jasleen Dhillon and Siddhant Mahurkar and Saumitra Kulkarni and Manav Malhotra and Veeky Baths},
journal= {arXiv preprint arXiv:2103.00854},
year = {2021}
}
备注
Accepted at the Multilingual Representation Learning workshop (EMNLP 2021)