中文

探索极低资源场景中的 NLP 基准

计算与语言 2026-03-23 v1

摘要

大型语言模型 (LLM) 在极低资源语言(如土著语言)上的有效性会下降,这主要归因于缺乏标记数据。尽管对这些语言的自然语言处理 (NLP) 数据集越来越感兴趣,但高质量数据集的可得性仍然有限,使得开发稳健的语言技术变得困难。本文聚焦于一种濒危的罗马尼亚语——拉丁语,具体针对 Val Badia 方言。我们利用小规模的拉丁-意大利语平行句子集合,通过翻译单语意大利语数据来创建情感分析和多选题回答 (MCQA) 的合成数据集。为确保语言质量和可靠性,我们在方法中应用了严格的过滤和回译程序。我们进一步展示,将这些合成数据集纳入机器翻译训练可显著优于现有的意大利-拉丁语翻译基线。我们的贡献包括首个公开可用的拉丁语情感分析和 MCQA 数据集,为该边缘化语言的更广泛 NLP 研究和下游应用奠定了基础资源。

关键词

引用

@article{arxiv.2509.03962,
  title  = {Exploring NLP Benchmarks in an Extremely Low-Resource Setting},
  author = {Ulin Nuha and Adam Jatowt},
  journal= {arXiv preprint arXiv:2509.03962},
  year   = {2026}
}

备注

The Association for Computational Linguistics: EACL 2026