中文

训练更多参数但需注意其位置:基于 PEFT 的语言适应见解

计算与语言 2024-12-18 v1

摘要

较小的 LLM 即使在中资源语言中仍面临重大挑战,特别是在语言特定知识方面——这是一个用机器翻译数据不易解决的问题。在这个关于冰岛语的案例研究中,我们旨在通过使用非结构化文本语料库专门化 LLM 来增强其生成性能。一个关键重点是在此适应过程中防止干扰模型处理长上下文的能力。通过使用各种参数高效微调(PEFT)方法和设置进行消融研究,我们发现增加可训练参数的数量能带来更好且更稳健的语言适应。放置在前馈层和瓶颈适配器中的 LoRA 在参数充足时显示出有希望的结果,而 prefix tuning 和 (IA)3 则不适用。尽管在 0-shot 摘要任务中的改进是一致的,但一些适应后的模型在处理较长上下文长度时存在困难,这一问题可以通过仅适应最后一层来缓解。

关键词

引用

@article{arxiv.2412.12674,
  title  = {Train More Parameters But Mind Their Placement: Insights into Language Adaptation with PEFT},
  author = {Jenny Kunz},
  journal= {arXiv preprint arXiv:2412.12674},
  year   = {2024}
}

备注

To appear at NoDaLiDa 2025