语言如何相互影响?探究 LM 微调期间的跨语言数据共享
计算与语言
2024-05-22 v2
摘要
多语言大语言模型(MLLM)在来自许多不同语言的数据上联合训练,使得各语言的表示可受益于其他语言的数据。零样本跨语言迁移的出色性能表明这些模型能够利用来自其他语言的数据。然而,语言在何种程度及何种条件下依赖彼此的数据仍不清楚。本研究中,我们使用 TracIn (Pruthi et al., 2020)——一种训练数据归因(TDA)方法——来检索多语言微调期间针对特定测试语言所见到的最具影响力的训练样本。这使我们能从新视角分析 MLLM 的跨语言共享机制。先前工作在模型参数层面研究跨语言共享,而我们提出首个在数据层面研究跨语言共享的方法。我们发现 MLLM 从微调早期阶段就依赖多语言数据,且这种依赖随微调推进逐渐增强。我们进一步研究不同微调语言如何影响给定测试语言上的模型性能,发现它们既能强化也能补充从测试语言自身数据获得的知识。
引用
@article{arxiv.2305.13286,
title = {How do languages influence each other? Studying cross-lingual data sharing during LM fine-tuning},
author = {Rochelle Choenni and Dan Garrette and Ekaterina Shutova},
journal= {arXiv preprint arXiv:2305.13286},
year = {2024}
}