中文

为何更好的跨语言对齐在更好的跨语言迁移中会失败:编码器案例

计算与语言 2026-03-20 v1

摘要

更好的跨语言对齐常被假设为更好的跨语言迁移的保证。然而,尽管显式对齐技术在增加嵌入相似性方面效果显著,但经常未能提高标记级下游性能。在本文中,我们表明,这种不匹配是由于对齐目标与下游任务目标在很大程度上是正交的,并且下游收益在不同语言和任务类型之间差异很大。我们分析了四个在不同语言对上对齐的 XLM-R 编码器模型,这些模型针对词性标注或句子分类进行微调。通过表征分析,包括嵌入距离、梯度相似性和梯度幅值(针对任务和对齐损失),我们发现:(1)嵌入距离本身是不可靠的预测器,无法可靠预测任务性能的改进或恶化;(2)对齐梯度与任务梯度常常接近正交,这表明优化一个目标可能对优化另一个目标贡献甚微。综合这些发现,我们解释了为何“更好的”对齐常常未能转化为“更好的”跨语言迁移。基于这些见解,我们提供了将跨语言对齐与任务特定微调结合的实用指南,强调对 carefully 选择损失函数的重要性。

关键词

引用

@article{arxiv.2603.18863,
  title  = {Why Better Cross-Lingual Alignment Fails for Better Cross-Lingual Transfer: Case of Encoders},
  author = {Yana Veitsman and Yihong Liu and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2603.18863},
  year   = {2026}
}