中文

Two CFG Nahuatl for automatic corpora expansion

计算与语言 2025-12-17 v1

摘要

本文旨在介绍两种用于纳瓦特语语料库自动扩充的上下文无关语法(CFG)。纳瓦特语是一种美洲原住民语言(也是墨西哥的国家语言),属于 π 语言类型,即数字资源极少的语言。因此,现有的用于学习大型语言模型(LLM)的语料几乎不存在,构成了显著挑战。目标是生成大量语法正确的人工纳瓦特语句,从而扩充语料库,用于学习非上下文嵌入。为此,我们引入两种新的纳瓦特语 CFG,并以生成模式使用这些语法。通过这些语法,可显著扩充纳瓦特语语料库,随后可用于学习嵌入并评估其在句子语义相似性任务中的相关性。结果表明,相较于仅使用原始语料库获得的结果,利用人工扩充后的语料库在性能上实现了提升,同时也表明经济型嵌入往往优于某些 LLM。

关键词

引用

@article{arxiv.2512.14239,
  title  = {Two CFG Nahuatl for automatic corpora expansion},
  author = {Juan-José Guzmán-Landa and Juan-Manuel Torres-Moreno and Miguel Figueroa-Saavedra and Ligia Quintana-Torres and Graham Ranger Martha-Lorena Avendaño-Garrido},
  journal= {arXiv preprint arXiv:2512.14239},
  year   = {2025}
}

备注

15 pages, 5 figures, 8 tables