LangGPS:面向联合多语言指令调优的数据预选中的语言可分离性
计算与语言
2025-11-14 v1
摘要
联合多语言指令调优是提高大型语言模型 (LLM) 多语言指令跟随能力和下游性能的常用方法,但所得的多语言能力对训练数据的组成和选择高度敏感。现有选择方法通常基于文本质量、多样性或任务相关性等特征,往往忽视多语言数据的内在语言结构。在本文中,我们提出 LangGPS,一种轻量级的两阶段预选框架,由语言可分离性指导,这一度量衡量了模型表示空间中不同语言样本能被区分的程度。LangGPS 首先根据可分离性得分过滤训练数据,然后使用现有选择方法对子集进行精炼。广泛的实验在六个基准测试和 22 种语言上表明,在现有选择方法之上应用 LangGPS 可提高其在多语言训练中的有效性和通用性,尤其是在理解任务和低资源语言方面。进一步分析揭示,高度可分离的样本有助于形成更清晰的语言边界并支持更快的适应,而低可分离性的样本则倾向于作为跨语言对齐的桥梁。此外,我们发现语言可分离性可作为多语言课程学习的有效信号,其中对可分离性水平多样化的样本交叉输入可获得稳定且通用的提升。综上,我们希望本工作提供一种关于多语言情境下数据效用的新视角,并支持开发更以语言为导导的 LLM。
引用
@article{arxiv.2511.10229,
title = {LangGPS: Language Separability Guided Data Pre-Selection for Joint Multilingual Instruction Tuning},
author = {Yangfan Ye and Xiaocheng Feng and Xiachong Feng and Lei Huang and Weitao Ma and Qichen Hong and Yunfei Lu and Duyu Tang and Dandan Tu and Bing Qin},
journal= {arXiv preprint arXiv:2511.10229},
year = {2025}
}
备注
AAAI2026 Main Track Accepted