中文

爱丁堡大学在 WMT22 代码混合共享任务(MixMT)中的提交

计算与语言 2022-10-21 v1

摘要

爱丁堡大学参与了 WMT22 代码混合翻译共享任务。该任务包含两个子任务:i)从平行的印地语和英语句子生成代码混合的印地语/英语(Hinglish)文本;ii)从 Hinglish 到英语的机器翻译。由于两个子任务均被视为低资源任务,我们将精力集中在细致的数据生成与整理上,特别是利用单语资源的反向翻译。对于子任务 1,我们探究了受限解码对英语和音译子词以生成 Hinglish 的影响。对于子任务 2,我们研究了不同的预训练技术,即比较现有机器翻译模型的简单初始化与对齐增强。两个子任务中,我们发现基线系统表现最佳。我们在两个子任务中的系统均为整体性能最优的提交之一。

关键词

引用

@article{arxiv.2210.11309,
  title  = {The University of Edinburgh's Submission to the WMT22 Code-Mixing Shared Task (MixMT)},
  author = {Faheem Kirefu and Vivek Iyer and Pinzhen Chen and Laurie Burchell},
  journal= {arXiv preprint arXiv:2210.11309},
  year   = {2022}
}