超越共享词表:增强多语言机器翻译中跨语言的表征词相似性
计算与语言
2024-01-23 v3 机器学习
摘要
在多语言神经机器翻译(MNMT)中,使用跨语言共享的词表是常见做法。除了其简单设计外,共享词元在正向知识迁移中发挥重要作用,前提是假设共享词元在不同语言中指代相似含义。然而,当词重叠较小时,尤其因书写系统不同,迁移会受到抑制。本文中,我们通过词等价类定义词级信息迁移路径,并依赖图网络融合跨语言的词嵌入。我们的实验证明了本方法的优势:1)含义相似词的嵌入在跨语言上更好对齐;2)我们的方法在高资源与低资源 MNMT 上取得一致的最高 2.3 个 BLEU 点的提升;3)所需可训练参数增加少于 1.0\%,计算成本有限增加,而推理时间与基线相同。我们向社区发布了代码库。
引用
@article{arxiv.2305.14189,
title = {Beyond Shared Vocabulary: Increasing Representational Word Similarities across Languages for Multilingual Machine Translation},
author = {Di Wu and Christof Monz},
journal= {arXiv preprint arXiv:2305.14189},
year = {2024}
}
备注
15 pages, 3 figures