MIDB: 多语言指令数据增强器:提升指令综合中的文化平等
计算与语言
2025-11-12 v2
摘要
尽管对数据质量存有疑虑,但指令综合已被广泛应用于大语言模型的指令调谐(IT),作为经济且快速的替代方案。近期努力集中于提高英语合成指令对的质量,已促进了以英语为中心的大语言模型的 IT。然而,多语言合成指令对的数据质量问题更为严重,因为常见的做法是通过机器翻译将英语合成数据翻译成其他语言。除了已知的英语合成数据中的内容错误之外,多语言合成指令数据还暴露于机器翻译引入的缺陷,并面临目标语言本地化不足的问题,导致训练有力的大语言模型在文化方面存在不平等。本文提出 MIDB,一个多语言指令数据增强器,用于自动解决多语言合成数据中的质量问题。MIDB 在约 36.8k 个跨 16 种语言的修订示例上进行训练,由人类语言专家进行人工标注,从而可以提高低质量数据,解决内容错误和机器翻译缺陷,并改进这些合成数据的本地化。无论是自动评估还是人类评估都表明,MIDB 不仅在 16 种语言中稳定地提高了指令数据质量,而且在 MIDB 提升的数据上微调的多语言大语言模型在指令跟随和文化理解能力方面都得到了显著提升,表明其在语言和文化平等方面取得了改善。
引用
@article{arxiv.2505.17671,
title = {MIDB: Multilingual Instruction Data Booster for Enhancing Cultural Equality in Multilingual Instruction Synthesis},
author = {Yilun Liu and Chunguang Zhao and Xinhua Yang and Hongyong Zeng and Shimin Tao and Weibin Meng and Minggui He and Yan Yu and Hongxia Ma and Li Zhang and Daimeng Wei and Boxing Chen},
journal= {arXiv preprint arXiv:2505.17671},
year = {2025}
}
备注
accepted by AAAI 2026