中文

一种用于 Nawatl 语料库增强的初步上下文无关语法

计算与语言 2025-10-07 v1 人工智能

摘要

本文介绍了一种针对 Nawatl 语言的上下文无关语法(CFG)。Nawatl(或称 Nahuatl)是一种美洲原住民语言,属于 π\pi 类型语言,即数字资源极其有限的语言,机器学习可用的语料几乎不存在。本文的目标是生成大量语法正确的人工句子,以增加用于语言模型训练的语料库。我们希望展示,语法能够显著扩展我们称为 π\pi-\textsc{yalli} 的语料库。经丰富后的语料库使我们能够训练诸如 FastText 等算法,并在句子级别语义任务上对其进行评估。初步结果表明,运用该语法后,与一些大语言模型(LLMs)相比,实现了显著的改进。然而,观察到若要获得更大的改进,仍需开发更有效地建模 Nawatl 语言的语法。

关键词

引用

@article{arxiv.2510.04945,
  title  = {A First Context-Free Grammar Applied to Nawatl Corpora Augmentation},
  author = {Juan-José Guzmán-Landa and Juan-Manuel Torres-Moreno and Miguel Figueroa-Saavedra and Ligia Quintana-Torres and Martha-Lorena Avendaño-Garrido and Graham Ranger},
  journal= {arXiv preprint arXiv:2510.04945},
  year   = {2025}
}

备注

11 pages, 7 tables, 1 figure