中文

一切皆在上下文学习!向大语言模型教授极低资源语言

计算与语言 2025-08-27 v1

摘要

极低资源语言,尤其是那些使用罕见文字的语言,如图1所示,在很大程度上仍未得到大语言模型(LLM)的支持。这部分是由于缺乏训练数据等复合因素造成的。本文首次全面分析了LLM是否能够纯粹通过上下文学习(ICL),在有或没有辅助对齐信号的情况下习得此类语言,以及这些方法与参数高效微调(PEFT)相比如何。我们在三个最先进的多语言LLM上系统地评估了20种代表性不足的语言。我们的发现凸显了当语言及其文字在LLM中均极度缺乏代表性时,PEFT的局限性。相比之下,带有语言对齐的零样本上下文学习对极低资源语言效果显著,而对于LLM中代表性相对较好的语言,少样本上下文学习或PEFT则更为有益。针对从事极低资源语言工作的LLM实践者,我们基于研究结果总结了将LLM适配到低资源语言的指导原则,例如,避免在未见过的文字的语言上微调多语言模型。

关键词

引用

@article{arxiv.2508.19089,
  title  = {It's All About In-Context Learning! Teaching Extremely Low-Resource Languages to LLMs},
  author = {Yue Li and Zhixue Zhao and Carolina Scarton},
  journal= {arXiv preprint arXiv:2508.19089},
  year   = {2025}
}

备注

Accepted by EMNLP 2025