中文

ACADATA:学术数据平行语料库

计算与语言 2025-10-16 v2

摘要

我们提出 ACADATA,这是一个用于学术翻译的高质量平行数据集,包含两个子集:ACAD-TRAIN 包含约150万篇跨96种语言方向的作者生成段落对;ACAD-BENCH 是一个涵盖12种语言方向的约6000篇翻译的精选评估集。为验证其实用性,我们在 ACAD-TRAIN 上微调了两个大型语言模型(LLM),并在 ACAD-BENCH 上对其进行基准测试,评估 specialized machine-translation systems、通用型开源 LLM 和多个大型专有模型。实验结果表明,在 ACAD-TRAIN 上进行微调可平均提升 7B 参数模型的学术翻译质量提升 6.1 分,2B 参数模型提升 12.4 分 d-BLEU 分数,同时在从英文翻译时提升了长文本翻译质量,提升幅度可达 24.9%。最终型化的顶尖模型在学术翻译领域超越了最佳的专有模型和开源模型。通过发布 ACAD-TRAIN、ACAD-BENCH 和微调后的模型,我们为社区提供了一个推动学术领域和长文本翻译研究发展的宝贵资源。

关键词

引用

@article{arxiv.2510.12621,
  title  = {ACADATA: Parallel Dataset of Academic Data for Machine Translation},
  author = {Iñaki Lacunza and Javier Garcia Gilabert and Francesca De Luca Fornaciari and Javier Aula-Blasco and Aitor Gonzalez-Agirre and Maite Melero and Marta Villegas},
  journal= {arXiv preprint arXiv:2510.12621},
  year   = {2025}
}