中文

M-DaQ:面向指令微调数据的多语言多样性与质量检索

计算与语言 2026-05-01 v2

摘要

多语言指令微调(IFT)使大型语言模型能够在多样化的语言和文化背景下获得泛化能力;然而,高质量、系统性筛选的多语言IFT数据集仍显稀缺。为解决这一问题,我们提出M-DaQ(Multilingual Diversity and Quality),一个兼顾指令-响应质量与跨语言语义多样性的多样性感知采样框架。M-DaQ 利用精调的质量评分模型,结合最大边际相关性(MMR)启发的选择策略,以构建平衡且高保真度的训练数据。此外,我们首次系统性地研究了“表面对齐假设”在多语言环境中的情况。跨18种语言的广泛评估表明,使用M-DaQ 精选数据训练的模型,在Alpaca-Eval 和 MT-Bench 上平均获胜率超过60%。此外,补充的人类评估也印证了这些提升,强调在文化相关性、情境恰当性和指令遵循能力方面的显著改进。代码已公开,以促进可重复性和后续研究。

关键词

引用

@article{arxiv.2509.15549,
  title  = {M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets},
  author = {Chunguang Zhao and Yilun Liu and Pufan Zeng and Yuanchang Luo and Shimin Tao and Minggui He and Weibin Meng and Song Xu and Chen Liu and Hongxia Ma and Li Zhang and Boxing Chen and Daimeng Wei},
  journal= {arXiv preprint arXiv:2509.15549},
  year   = {2026}
}

备注

Accepted by SIGIR 2026 Short