面向多语词汇资源的构建:一种机器翻译辅助且人在回路的多语平行语料库及其多词表达式标注
计算与语言
2025-12-23 v2 人工智能
摘要
在本工作中,我们介绍了一个机器翻译(MT)辅助且人在回路的、带有多词表达式(MWEs)标注的多语平行语料库的构建,该语料库名为 AlphaMWE。其中的多词表达式包括 PARSEME 共享任务中定义的、以动词作为所研究词条中心的动词性多词表达式(vMWEs)。标注的 vMWEs 还经过人工的双语和多语对齐。涵盖的语言包括阿拉伯语、汉语、英语、德语、意大利语和波兰语,其中阿拉伯语语料包含来自埃及和突尼斯的标准语和方言变体。我们的原始英语语料提取自 2018 年的 PARSEME 共享任务。我们对该源语料进行了机器翻译,随后由人工进行译后编辑和目标语多词表达式标注。为限制错误,我们实施了严格的质量控制,即每句机器翻译输出先经人工译后编辑与标注,再经第二次人工质量复查,直至标注者达成共识。我们在语料准备过程中的一个发现是,多词表达式的准确翻译对机器翻译系统构成挑战,这一点体现在人在回路指标 HOPE 的结果中。为促进进一步的机器翻译研究,我们给出了机器翻译系统在执行多词表达式相关翻译时所遇错误类型的分类。为更全面地了解机器翻译问题,我们选取了四种流行的当前最优(SOTA)机器翻译系统进行比较,即 Microsoft Bing Translator、GoogleMT、Baidu Fanyi 和 DeepL MT。得益于人工专家的噪声去除、翻译译后编辑和多词表达式标注,我们相信 AlphaMWE 数据集将成为单语和跨语言研究(如多词术语词典编纂、机器翻译和信息抽取)的一项宝贵资源。
引用
@article{arxiv.2011.03783,
title = {Towards a resource for multilingual lexicons: an MT assisted and human-in-the-loop multilingual parallel corpus with multi-word expression annotation},
author = {Lifeng Han and Najet Hadj Mohamed and Malak Rassem and Gareth Jones and Alan Smeaton and Goran Nenadic},
journal= {arXiv preprint arXiv:2011.03783},
year = {2025}
}
备注
Accepted by Journal of LRE, extended work from WS paper AlphaMWE