中文

恶魔藏在词对齐细节之中:基于翻译的跨语言迁移用于标记分类任务

计算与语言 2025-08-11 v2

摘要

基于翻译的跨语言迁移策略,如 translate-train(训练时使用从源语言翻译得到的噪声目标语言数据)和 translate-test(评估时使用从目标语言翻译得到的噪声源语言数据),在跨语言迁移 XLT 中表现竞争。然而,在标记分类任务的跨语言迁移中,这些策略涉及标签投影,即将原句中每个 token 的标签映射到其翻译版本中的对应位置。这一步骤具有挑战性。虽然词对齐器(word aligners, WAs)常被用于标签投影,但针对翻译驱动的跨语言迁移,如何应用这些工具的底层设计决策尚未系统调查。此外,近期基于标记的方法通过在翻译前(或后)插入标签来标记受控区域,声称在跨语言迁移的标签投影方面优于词对齐器。在本工作中,我们重新审视词对齐器用于标签投影,系统性地探讨了以下几个底层设计决策对标记级跨语言迁移的影响:(i) 用于在(多)token 区间之间投影标签的算法;(ii) 减少噪声标签数量的过滤策略;(iii) 对翻译句子的预分词。我们发现,这些决策都会显著影响翻译驱动的跨语言迁移性能,并表明在优化选择后,基于词对齐器的跨语言迁移性能至少与基于标记的方法相当。随后,我们引入了一种新的投影策略,通过集成 translate-train 和 translate-test 的预测,证明其在跨语言迁移中显著优于基于标记的投影方法。关键的是,我们展示所提出的集成方法还能降低对底层词对齐器设计选择的敏感性,从而在标记分类任务中实现更稳健的跨语言迁移。

关键词

引用

@article{arxiv.2505.10507,
  title  = {The Devil Is in the Word Alignment Details: On Translation-Based Cross-Lingual Transfer for Token Classification Tasks},
  author = {Benedikt Ebing and Goran Glavaš},
  journal= {arXiv preprint arXiv:2505.10507},
  year   = {2025}
}