TransAlign:机器翻译编码器也是强大的词对齐器
计算与语言
2025-11-03 v1
摘要
在大多数世界语言和NLP任务缺乏大规模训练数据的情况下,基于翻译的策略如基于翻译的测试——评估从目标语言翻译得到的噪声源语言数据——以及基于翻译的训练——在噪声目标语言数据上从源语言翻译进行训练——已被确立为跨语言迁移(XLT)中具有竞争力的方法。对于标记分类任务,这些策略需要标签投影:将原句中每个标记的标签映射到其对应项(或多个对应项)。为此,通常利用来自编码器语言模型如mBERT或LaBSE派生的多语言词对齐器(W)。尽管机器翻译(MT)与词对齐器之间显然存在关联,但从MT模型中提取词对齐的研究主要局限于利用编码器-解码器架构中的跨注意力,导致糟糕的词对齐结果。在本工作中,我们提出了TransAlign,一种新颖的词对齐器,利用大规模多语言MT模型的编码器。我们展示了TransAlign不仅实现了强大的词对齐性能,而且在MT-based XLT中显著优于流行的词对齐器和最先进的非词对齐器标签投影方法。
引用
@article{arxiv.2510.27337,
title = {TransAlign: Machine Translation Encoders are Strong Word Aligners, Too},
author = {Benedikt Ebing and Christian Goldschmied and Goran Glavaš},
journal= {arXiv preprint arXiv:2510.27337},
year = {2025}
}