面向低资源语言的跨语言适应:三管齐下的做法
计算与语言
2024-06-26 v1
摘要
低资源语言凭其本质定义,往往在大型语言模型(LLM)的预训练语料中得到较少代表。本文中我们探讨了三种低资源跨语言方法,使 LLM 能够适应先前未遇见语言上的任务。Llama-2 是一种 LLM,其中印度语言(以及许多其他语言家族)仅占总计 2 万亿 token 预训练语料的不到 。本文中我们以 English 主导的 Llama-2 为载体,对孟加拉语、Hindi 和 Tamil 这三种印度语言进行跨语言迁移。在 ICL 和微调方面,我们研究了三种跨语言迁移方法。首先,我们发现通过在 LLM 中添加来自主导语言的额外监督信号,可在 ICL 和微调中实现提升。其次,在 ICL 下,对目标语言进行词序重排可能是有益的,但其影响在微调时会逐渐消退。最后,在一种低资源语言上的持续预训练可提升该模型在其他相关低资源语言上的性能。
引用
@article{arxiv.2406.17377,
title = {A Three-Pronged Approach to Cross-Lingual Adaptation with Multilingual LLMs},
author = {Vaibhav Singh and Amrith Krishna and Karthika NJ and Ganesh Ramakrishnan},
journal= {arXiv preprint arXiv:2406.17377},
year = {2024}
}