UPRPRC:复现并行资源库的统一流水线——联合国语料库
计算与语言
2025-09-22 v1 机器学习
摘要
多语言数据集的质量和可及性对于推进机器翻译至关重要。然而,以往基于联合国文档构建的语料库存在过程不透明、难以复现和规模有限等问题。为了应对这些挑战,我们引入了一个完整的端到端解决方案,涵盖从通过网络抓取获取数据到文本对齐的全过程。整个流程完全可复现,提供了一个极简的单机示例以及用于可扩展性的可选分布式计算步骤。在核心部分,我们提出了一种新的图辅助段落对齐(GAPA)算法,用于高效、灵活的段落级对齐。生成的语料库包含超过 7.13 亿个英语 token,规模是之前工作的两倍多。据我们所知,这是目前最大的完全由人工翻译、非 AI 生成内容组成的公开可用并行语料库。我们的代码和语料库在 MIT 许可下发布。
引用
@article{arxiv.2509.15789,
title = {UPRPRC: Unified Pipeline for Reproducing Parallel Resources -- Corpus from the United Nations},
author = {Qiuyang Lu and Fangjian Shen and Zhengkai Tang and Qiang Liu and Hexuan Cheng and Hui Liu and Wushao Wen},
journal= {arXiv preprint arXiv:2509.15789},
year = {2025}
}
备注
5 pages, 1 figure, submitted to ICASSP2026