探究大语言模型训练期间跨语言对齐的出现
计算与语言
2024-06-21 v1 人工智能
机器学习
摘要
多语言大语言模型(LLM)实现了惊人的零样子跨语言迁移性能。我们推测,这取决于其在没有来自平行句子的显式监督的情况下对语言进行对齐的能力。虽然已知不同语言中等价翻译句子的表示在收敛后相似,但如何在LLM预训练期间形成这种跨语言对齐仍不清楚。我们的研究利用内在探针技术,这些技术识别哪些神经元子编码语言特征,以关联跨语言神经元重叠度与特定模型的零样子跨语言迁移性能。在本研究中,我们依赖BLOOM——一种多语言自回归LLM——在不同训练步骤和模型规模下的检查点。我们观察到神经元重叠度与下游性能高度相关,这支持了我们关于导致有效跨语言迁移的条件的假设。有趣的是,我们还检测到在预训练过程中某些阶段的隐式对齐和多语言能力存在下降,这为多语言预训练动力学提供了新见解。
引用
@article{arxiv.2406.13229,
title = {Probing the Emergence of Cross-lingual Alignment during LLM Training},
author = {Hetong Wang and Pasquale Minervini and Edoardo M. Ponti},
journal= {arXiv preprint arXiv:2406.13229},
year = {2024}
}
备注
Accepted to Findings of the Association for Computational Linguistics: ACL 2024