XL-Suite:面向开放式生成的跨语言合成训练与评估数据
计算与语言
2025-09-30 v3 人工智能
机器学习
摘要
跨语言开放式生成——即以不同于查询的语言进行回复——是一个重要但研究不足的问题。本文提出了一种生成高质量合成数据的新技术 XL-Instruct,并引入了用于评估大型语言模型(LLM)跨语言生成能力的新基准 XL-AlpacaEval。我们的实验表明,仅使用 XL-Instruct 生成的 8K 条指令进行微调即可显著提升模型性能,使其针对 GPT-4o-Mini 的胜率从 7.4% 提升至 21.5%,并在多项细粒度质量指标上有所改善。此外,如我们的机器翻译版本 m-AlpacaEval 所示,在 XL-Instruct 上微调的基础 LLM 在同语言问答中展现出强大的零样本提升。这些一致的提升突显了 XL-Instruct 在多语言 LLM 训练后阶段中的重要作用。最后,我们公开发布了 XL-Suite,一套训练与评估数据集合,以促进跨语言开放式生成的研究。
引用
@article{arxiv.2503.22973,
title = {XL-Suite: Cross-Lingual Synthetic Training and Evaluation Data for Open-Ended Generation},
author = {Vivek Iyer and Pinzhen Chen and Ricardo Rei and Alexandra Birch},
journal= {arXiv preprint arXiv:2503.22973},
year = {2025}
}
备注
Accepted to EMNLP 2025 (Findings)