中文

LangMark:面向自动后编辑的多语言数据集

计算与语言 2025-11-24 v1

摘要

自动后编辑(APE)旨在纠正机器翻译文本中的错误,提升翻译质量,同时减少对人工介入的需求。尽管神经机器翻译(NMT)取得了进展,但有效APE系统的开发仍受制于缺乏专为NMT输出量身定制的大规模多语言数据集。为此,我们提出并公开了LangMark——一个新的人工标注的多语言APE数据集,覆盖英语至七种语言的翻译:巴西西语、法语、德语、意大利语、日语、俄语和西班牙语。数据集包含206,983个三元组,其中每个三元组由源段、其NMT输出以及人工后编辑翻译组成。由专家人类语言学家标注,数据集兼具语言多样性和规模。基于本数据集,我们实证表明,大语言模型(LLM)通过少样提示即可有效执行APE,提升了领先商业乃至专有机器翻译系统的表现。我们信念,这一新资源将促进未来APE系统的开发与评估。

关键词

引用

@article{arxiv.2511.17153,
  title  = {LangMark: A Multilingual Dataset for Automatic Post-Editing},
  author = {Diego Velazquez and Mikaela Grace and Konstantinos Karageorgos and Lawrence Carin and Aaron Schliem and Dimitrios Zaikis and Roger Wechsler},
  journal= {arXiv preprint arXiv:2511.17153},
  year   = {2025}
}

备注

15 pages, 8 figures, ACL 2025