中文

IndicSentEval:多语言Transformer模型如何有效编码印度语言语言学属性

计算与语言 2025-11-04 v2 人工智能 机器学习

摘要

基于Transformer的模型在自然语言处理领域取得了显著进展。为理解其运行机制并评估其可靠性,已有多项研究聚焦于:这些模型编码哪些语言学属性,以及其编码程度如何?当面对输入文本的扰动时,这些模型在编码语言学属性方面有多强大?然而,这些研究主要关注BERT和英语。在本文中,我们针对8种语言学属性在6种印度语言中通过13种不同扰动下的编码能力和鲁棒性进行了类似的探讨,使用9个多语言Transformer模型(7个通用模型和2个印度语言特定模型)。为开展此项研究,我们引入了一个新型多语言基准数据集IndicSentEval,包含约47K句子。我们意外发现,虽然绝大多数多语言模型在英语上表现出一致的编码性能,但在印度语言方面表现出混合结果。如预期,印度语言特定的多语言模型在印度语言中捕获语言学属性的能力优于通用模型。令人惊讶的是,通用模型在广泛上表现出比印度语言特定模型更好的鲁棒性,尤其是在诸如删除名词和动词、仅删除动词或仅保留名词等扰动下。总体而言,本研究为针对不同印度语言的流行多语言Transformer-based模型提供了有价值的探针和扰动特定的优势与弱点的见解。我们将代码和数据集公开分享至[https://github.com/aforakhilesh/IndicBertology]。

关键词

引用

@article{arxiv.2410.02611,
  title  = {IndicSentEval: How Effectively do Multilingual Transformer Models encode Linguistic Properties for Indic Languages?},
  author = {Akhilesh Aravapalli and Mounika Marreddy and Radhika Mamidi and Manish Gupta and Subba Reddy Oota},
  journal= {arXiv preprint arXiv:2410.02611},
  year   = {2025}
}

备注

25 pages, 11 figures, Accepted at IJCNLP-AACL 2025 Findings