探索跨语言潜变量移植:相互机遇与开放挑战
计算与语言
2026-04-13 v3
摘要
当前的大型语言模型(LLM)在多语言能力和文化适应性方面通常表现出不平衡,这主要归因于其以英语为中心的预训练数据。在本文中,我们引入并研究了跨语言潜变量移植(XTransplant),这是一种探测框架,旨在进一步利用模型在推理过程中内化的多语言知识,并考察其对 LLM 多语言能力和文化适应性的影响。XTransplant 框架使模型能够通过跨语言移植潜激活来利用英语和非英语资源的互补优势。通过广泛的分析,我们实证证明 XTransplant 作为一种跨语言交互形式,对 LLM 的多语言能力和文化适应性具有互惠效应,特别是对于低资源语言和文化。我们进一步揭示,注意力模块在支持多语言理解方面发挥着关键作用,而前馈模块更擅长捕捉特定文化的知识。此外,我们对 XTransplant 的稳定性、有效性和泛化能力进行了深入分析。通过探测 XTransplant 的性能上限,我们揭示了当前 LLM 多语言潜力的严重未充分利用——这是一个仍然悬而未决的挑战。我们希望我们的分析为推进跨语言交互和更好地利用模型内化的多语言知识提供一个新的视角。
引用
@article{arxiv.2412.12686,
title = {Exploring Cross-lingual Latent Transplantation: Mutual Opportunities and Open Challenges},
author = {Yangfan Ye and Xiaocheng Feng and Xiachong Feng and Libo Qin and Yichong Huang and Lei Huang and Weitao Ma and Qichen Hong and Zhirui Zhang and Yunfei Lu and Xiaohui Yan and Duyu Tang and Dandan Tu and Bing Qin},
journal= {arXiv preprint arXiv:2412.12686},
year = {2026}
}
备注
IEEE Transactions on Audio, Speech and Language Processing