中文

提问的艺术:面向合成数据的多语言提示优化

计算与语言 2025-10-23 v1

摘要

合成数据已成为扩展大型语言模型的基石,但其多语言应用仍受限于基于翻译的提示。这种策略继承了以英语为中心的框架和风格,忽视了文化维度,最终限制了模型的泛化能力。我们认为,被忽视的提示空间——即定义训练分布的输入本身——为提升多语言性能提供了更强大的杠杆。我们引入了一个轻量级的提示空间优化框架,在该框架中,翻译后的提示被系统地转换为自然性、文化适应性和难度增强。使用现成的多语言LLM,我们将这些转换应用于涵盖7个语系的12种语言的提示。在相同的数据条件下,我们的方法相较于仅翻译的基线在下游任务上取得了显著且一致的提升:Global-MMLU准确率提升+4.7%,Flores XCometXL提升+2.4%,在mArenaHard偏好中获胜率提升+35.3%。我们将提示空间优化确立为一种简单而强大的范式,用于构建更鲁棒、更具文化根基且具备全球能力的多语言LLM。

关键词

引用

@article{arxiv.2510.19806,
  title  = {The Art of Asking: Multilingual Prompt Optimization for Synthetic Data},
  author = {David Mora and Viraat Aryabumi and Wei-Yin Ko and Sara Hooker and Julia Kreutzer and Marzieh Fadaee},
  journal= {arXiv preprint arXiv:2510.19806},
  year   = {2025}
}