English

M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets

Computation and Language 2026-05-01 v2

Abstract

Multilingual instruction fine-tuning (IFT) empowers large language models to generalize across diverse linguistic and cultural contexts; however, high-quality, systematically curated multilingual IFT datasets remain scarce. To address this gap, we propose M-DaQ (Multilingual Diversity and Quality), a diversity-aware sampling framework that jointly optimizes instruction-response quality and cross-lingual semantic diversity. M-DaQ leverages a fine-tuned Quality Scoring Model alongside a maximal marginal relevance-inspired selection strategy to construct balanced, high-fidelity training data. Furthermore, we present the first systematic investigation of the Superficial Alignment Hypothesis in multilingual settings. Extensive evaluations across 18 languages demonstrate that models trained on M-DaQ-curated data achieve average win rates exceeding 60% against strong baselines on Alpaca-Eval and MT-Bench. Complementary human evaluations corroborate these gains, highlighting significant improvements in cultural relevance, contextual appropriateness, and instruction-following capability. The code are publicly released to facilitate reproducibility and future research.

Keywords

Cite

@article{arxiv.2509.15549,
  title  = {M-DaQ: Retrieving Samples with Multilingual Diversity and Quality for Instruction Fine-Tuning Datasets},
  author = {Chunguang Zhao and Yilun Liu and Pufan Zeng and Yuanchang Luo and Shimin Tao and Minggui He and Weibin Meng and Song Xu and Chen Liu and Hongxia Ma and Li Zhang and Boxing Chen and Daimeng Wei},
  journal= {arXiv preprint arXiv:2509.15549},
  year   = {2026}
}

Comments

Accepted by SIGIR 2026 Short

R2 v1 2026-07-01T05:45:02.700Z