低资源语言中提示大型语言模型的少样本跨语言迁移
摘要
大型预训练语言模型 (PLM) 处于自然语言处理进展的前沿。PLM 的一种广泛用例是“提示”(或在上下文学习),即用户在提示 PLM 对新示例执行任务之前,向 PLM 提供任务描述和一些已完成的任务示例作为上下文。只有最大、能力最强的 PLM 才能有效地执行在上下文学习,而这些模型通常主要使用英语语料库训练,从而将所有其他语言抛在身后。大多数语言的数据限制阻碍了能够进行提示的特定语言 PLM 的训练。尽管提示设置方面的研究激增,但 PLM 应如何专门针对提示进行跨语言适应仍不清楚。我们评估了适应 LLaMa(一种主要用英语训练的 70 亿参数开源 PLM)以在低资源语言(即卢旺达语、豪萨语和卢干达语)中进行提示的可能方法。我们考虑了三种方法:少样本提示 (prompt)、语言自适应微调 (LAFT) 和神经机器翻译 (translate),并在抽象摘要、多类主题分类和命名实体识别任务上进行了评估。虽然 LAFT 携带最大的计算成本且直观上应导致最佳结果,但我们的实验表明,LAFT 仅是适应 PLM 进行提示的偶尔最优选择。相反,translate 和 prompt 设置是针对所选低资源语言进行少样本提示的计算高效且具成本效益的方法。我们发现结果取决于任务和语言,但发现提示方法在所有任务和语言上的平均表现最佳。结果显示,当在所有任务和语言上聚合时,prompt 设置的表现优于 translate 和 LAFT,且具有统计显著性。
引用
@article{arxiv.2403.06018,
title = {Few-Shot Cross-Lingual Transfer for Prompting Large Language Models in Low-Resource Languages},
author = {Christopher Toukmaji},
journal= {arXiv preprint arXiv:2403.06018},
year = {2024}
}
备注
47 pages, 26 figures; a thesis submitted in partial satisfaction of the requirements for the degree of Bachelor of Science in Computer Science at the University of California - Santa Cruz