VietMix:面向越南语-英语语码混合机器翻译的天然平行语料库与数据增强框架
计算与语言
2026-01-12 v2 人工智能
机器学习
摘要
机器翻译(MT)系统在面对语码混合文本时普遍会出现性能退化。对于缺乏专用平行语料库的低资源语言而言,这一问题更为严峻。本研究直接针对越南语-英语这一语言语境填补了该空白,该语境的特点包括正字法歧义以及非正式文本中经常省略变音符号。我们引入了 VietMix,这是首个由专家翻译的、天然存在的越南语-英语语码混合文本平行语料库。我们通过开发一个利用迭代微调和定向过滤的数据增强流程,确立了 VietMix 的实用性。实验表明,使用我们的数据增强的模型比强基线回译模型高出多达 +3.5 个 xCOMET 点,并将零样本模型提升了多达 +11.9 个点。我们的工作为这一具有挑战性的语言对提供了基础资源,并为在其他低资源场景下构建和增强语料库提供了经过验证的、可迁移的框架。
引用
@article{arxiv.2505.24472,
title = {VietMix: A Naturally-Occurring Parallel Corpus and Augmentation Framework for Vietnamese-English Code-Mixed Machine Translation},
author = {Hieu Tran and Phuong-Anh Nguyen-Le and Huy Nghiem and Quang-Nhan Nguyen and Wei Ai and Marine Carpuat},
journal= {arXiv preprint arXiv:2505.24472},
year = {2026}
}
备注
EACL 2026