中文

CC-Tuning:一种用于改进联合多语言监督微调的跨语言连接机制

计算与语言 2025-06-03 v1

摘要

当前的大型语言模型(LLM)由于其以英语为中心的训练语料库,通常表现出不平衡的多语言能力。为了解决这一问题,现有的在数据层面进行操作的微调方法(例如,通过数据增强或蒸馏)通常引入隐式的跨语言对齐,忽略了在潜在层面进行更深层跨语言交互的潜力。在本工作中,我们提出了 CC-Tuning,这是一种新颖的多语言微调范式,它在潜在层面显式地建立了一种跨语言连接机制。在训练期间,CC-Tuning 融合来自英语和非英语输入的前馈激活,使模型能够同时受益于这两种语言资源。这一过程由一个可训练的决策器(Decision Maker)辅助完成,该决策器用于识别有益的激活。此外,在推理期间,利用一个变换矩阵(Transform Matrix)通过表示变换来模拟单语言设置下的跨语言连接。我们在涵盖 22 种语言的 6 个基准上的实验表明,CC-Tuning 优于普通 SFT,并为数据层面的增强方法提供了一种强有力的潜在层面替代方案。进一步的分析还强调了 CC-Tuning 的实用性,以及潜在层面的跨语言交互在提升 LLM 多语言性能方面的潜力。

关键词

引用

@article{arxiv.2506.00875,
  title  = {CC-Tuning: A Cross-Lingual Connection Mechanism for Improving Joint Multilingual Supervised Fine-Tuning},
  author = {Yangfan Ye and Xiaocheng Feng and Zekun Yuan and Xiachong Feng and Libo Qin and Lei Huang and Weitao Ma and Yichong Huang and Zhirui Zhang and Yunfei Lu and Xiaohui Yan and Duyu Tang and Dandan Tu and Bing Qin},
  journal= {arXiv preprint arXiv:2506.00875},
  year   = {2025}
}

备注

ACL2025 main conference, long paper