爱丁堡大学在 WMT22 代码混合共享任务(MixMT)中的提交
计算与语言
2022-10-21 v1
摘要
爱丁堡大学参与了 WMT22 代码混合翻译共享任务。该任务包含两个子任务:i)从平行的印地语和英语句子生成代码混合的印地语/英语(Hinglish)文本;ii)从 Hinglish 到英语的机器翻译。由于两个子任务均被视为低资源任务,我们将精力集中在细致的数据生成与整理上,特别是利用单语资源的反向翻译。对于子任务 1,我们探究了受限解码对英语和音译子词以生成 Hinglish 的影响。对于子任务 2,我们研究了不同的预训练技术,即比较现有机器翻译模型的简单初始化与对齐增强。两个子任务中,我们发现基线系统表现最佳。我们在两个子任务中的系统均为整体性能最优的提交之一。
引用
@article{arxiv.2210.11309,
title = {The University of Edinburgh's Submission to the WMT22 Code-Mixing Shared Task (MixMT)},
author = {Faheem Kirefu and Vivek Iyer and Pinzhen Chen and Laurie Burchell},
journal= {arXiv preprint arXiv:2210.11309},
year = {2022}
}