众志成城:面向低资源语言的多语言自动译后编辑
计算与语言
2024-10-24 v1
摘要
本探索性研究调查了多语言自动译后编辑(APE)系统在提升低资源印度-雅利安语言机器翻译质量方面的潜力。聚焦于两个密切相关的语言对——英语-马拉地语和英语-印地语,我们利用语言相似性开发了一个稳健的多语言APE模型。为促进跨语言迁移,我们生成了合成印地语-马拉地语和马拉地语-印地语APE三元组。此外,我们引入了一个质量估计(QE)-APE多任务学习框架。实验结果既凸显了APE和QE的互补性,也观察到QE-APE多任务学习有助于有效的领域自适应。我们的实验表明,多语言APE模型分别比对应的英语-印地语和英语-马拉地语单语言对模型高出和个TER点,通过多任务学习(和个TER点)、数据增强(和个TER点)和领域自适应(和个TER点),多语言APE模型还获得了进一步的显著改进。我们在https://github.com/cfiltnlp/Multilingual-APE上公开发布了本研究期间积累的合成数据、代码和模型。
引用
@article{arxiv.2410.17973,
title = {Together We Can: Multilingual Automatic Post-Editing for Low-Resource Languages},
author = {Sourabh Deoghare and Diptesh Kanojia and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2410.17973},
year = {2024}
}
备注
Accepted at Findings of EMNLP 2024