中文

面向低资源藏语的大型语言模型适应:基于双阶段持续预训练与监督微调的研究

偏微分方程分析 2025-12-04 v1 泛函分析

摘要

适应低资源语言的大型语言模型仍是一个主要挑战,因为数据稀缺且存在跨语言漂移。本文针对藏语——一种形态丰富且处于边缘地位的语言——对 Qwen2.5-3B 进行双阶段适应。我们采用持续预训练 (CPT) 建立藏语语言 grounding,随后采用监督式微调 (SFT) 实现任务和翻译专业化。经验评估显示,困惑度持续下降(从 2.98 降至 1.54),中文→藏语翻译质量显著提升(BLEU:0.046→0.261;chrF:2.2→6.6)。在 Qwen3-4B 的 435 层中进行的层级分析表明,适应主要集中在嵌入层和输出头部,mid-late MLP 投影编码了领域特定的转换。我们的发现表明,CPT 构建了藏语语义流形,而 SFT 通过最小的表示扰动来锐化任务对齐。这项研究为大型语言模型的藏语适应提供了首个定量探索,并提供了一个开放、可复现的框架,用于将多语言基础模型扩展到低资源环境。

关键词

引用

@article{arxiv.2512.03978,
  title  = {On well-posedness for second-order degenerate parabolic equations with unbounded lower-order terms},
  author = {Khalid Baadi},
  journal= {arXiv preprint arXiv:2512.03978},
  year   = {2025}
}

备注

40 pages. Comments are welcome