通过深度监督微调提升以英语为中心的大语言模型非英语能力
计算与语言
2025-03-06 v2
摘要
大语言模型(LLM)在多语言语言理解与生成方面取得了显著进展,但由于训练数据不平衡,其非英语语言能力有限。近期研究揭示了 LLM 的英语-枢纽多语言机制,即 LLM 在底层隐式将非英语查询转换为英语查询,并在中层采用英语进行思考。然而,由于缺乏对中间层跨语言对齐的显式监督,模型在这些阶段的内部表示可能不准确。本文引入一种深度监督微调方法(DFT),在模型内部层加入额外监督以引导其工作流程。具体而言,我们在 LLM 的不同层上引入两个训练目标:一个位于底层,用于约束目标语言向英语的转换,另一个位于中层,用于约束以英语进行推理。为实现指导目的,我们设计了两种监督信号类型:logits 和特征,分别代表更严格的约束和较为宽松的指导。该方法引导模型在处理非英语输入时,不仅考虑最终生成结果,还确保内部表示的准确性。我们在典型的英语中心大型模型(LLaMA-2 和 Gemma-2)上进行了大规模实验,结果表明,该方法在多个多语言数据集上显著优于传统微调方法。
引用
@article{arxiv.2503.01275,
title = {Enhancing Non-English Capabilities of English-Centric Large Language Models through Deep Supervision Fine-Tuning},
author = {Wenshuai Huo and Xiaocheng Feng and Yichong Huang and Chengpeng Fu and Baohang Li and Yangfan Ye and Zhirui Zhang and Dandan Tu and Duyu Tang and Yunfei Lu and Hui Wang and Bing Qin},
journal= {arXiv preprint arXiv:2503.01275},
year = {2025}
}
备注
Accepted at AAAI 2025