中文

突破事实:突破事实:土耳其语族中的跨语言迁移与参数高效适应:面向低资源语言模型的理论框架

计算与语言 2026-04-09 v1 人工智能

摘要

大型语言模型(LLM)已经变革了自然语言处理,但其能力在不同语言之间存在不均衡。大多数多语言模型主要在高资源语言上训练,导致许多拥有大量说话人的语言在训练数据和评估基准中被严重低估。这一不平衡在土耳其语族中尤为突出。本文提出了一种用于研究土耳其语族中跨语言迁移和参数高效适应的理论框架,聚焦于阿塞拜疆语、哈萨克语、乌兹别克语、土库曼语和加古尔齐语。这些语言在句法和形态学方面具有 substantial 的相似性,同时在可用数字资源方差异很大,使其成为分析多语言适应策略的自然环境。我们整合了多语言表征学习和参数高效微调技术(如 LoRA)的见解,发展出一种概念扩展模型,描述适应性能如何取决于模型容量、适应数据规模和适应模块的表达能力。为形式化相关语言之间的迁移潜力,我们引入土耳其语迁移系数(TTC),这是一种包含土耳其语之间形态相似性、词汇重叠、句法结构和脚本兼容性的理论度量。该框架突显了如何利用句法相似性实现高效的多语言迁移,同时也识别了参数高效适应在极低资源情境中的结构限制。

关键词

引用

@article{arxiv.2604.06202,
  title  = {Cross-Lingual Transfer and Parameter-Efficient Adaptation in the Turkic Language Family: A Theoretical Framework for Low-Resource Language Models},
  author = {O. Ibrahimzade and K. Tabasaransky},
  journal= {arXiv preprint arXiv:2604.06202},
  year   = {2026}
}

备注

22 pages, no figures, 1 table