多语言教师:评估语言模型用于多语言合成数据生成
计算与语言
2026-04-14 v1
摘要
从语言模型中合成监督微调数据以教授较小模型多语言任务已变得越来越普遍。然而,教师模型的选择往往是临时的,通常默认选择最大的可用选项,尽管这些模型在非英语语言中可能存在显著的能力差距。这种做法可能导致低质量的合成数据和次优的学生下游性能。在这项工作中,我们系统地描述了有效多语言教师的特征。我们通过一个称为多语言得分的指标,将数据质量的内在度量与学生模型的外在性能联系起来;评估了10个LM在6种类型多样的语言上的表现,生成了超过140万个SFT样本并训练了240个学生模型。在测试的模型中,Gemma 3 27B和Aya Expanse 32B在不同学生基础模型系列中始终是有效的教师。进一步的分析表明,模型规模本身并不能显著预测教师有效性;相反,提示多样性、长度和响应流畅性等数据质量特征捕获了内在数据质量超过93.3%的方差,并能预测学生性能。最后,我们提供了实用建议,包括匹配师生对的模型系列,以及从现有提示进行翻译或响应,这可以为资源较少的语言带来改进。我们希望我们的工作能推动多语言合成数据和LM开发中数据为中心的研究。
引用
@article{arxiv.2604.11290,
title = {Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation},
author = {Lester James V. Miranda and Ivan Vulić and Anna Korhonen},
journal= {arXiv preprint arXiv:2604.11290},
year = {2026}
}