中文

XL-Suite:面向开放式生成的跨语言合成训练与评估数据

计算与语言 2025-09-30 v3 人工智能 机器学习

摘要

跨语言开放式生成——即以不同于查询的语言进行回复——是一个重要但研究不足的问题。本文提出了一种生成高质量合成数据的新技术 XL-Instruct,并引入了用于评估大型语言模型(LLM)跨语言生成能力的新基准 XL-AlpacaEval。我们的实验表明,仅使用 XL-Instruct 生成的 8K 条指令进行微调即可显著提升模型性能,使其针对 GPT-4o-Mini 的胜率从 7.4% 提升至 21.5%,并在多项细粒度质量指标上有所改善。此外,如我们的机器翻译版本 m-AlpacaEval 所示,在 XL-Instruct 上微调的基础 LLM 在同语言问答中展现出强大的零样本提升。这些一致的提升突显了 XL-Instruct 在多语言 LLM 训练后阶段中的重要作用。最后,我们公开发布了 XL-Suite,一套训练与评估数据集合,以促进跨语言开放式生成的研究。

关键词

引用

@article{arxiv.2503.22973,
  title  = {XL-Suite: Cross-Lingual Synthetic Training and Evaluation Data for Open-Ended Generation},
  author = {Vivek Iyer and Pinzhen Chen and Ricardo Rei and Alexandra Birch},
  journal= {arXiv preprint arXiv:2503.22973},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 (Findings)