中文

发现语言无关多语言表示的低秩子空间

计算与语言 2024-01-12 v1 机器学习

摘要

大型预训练多语言语言模型(ML-LM)在没有直接跨语言监督的情况下,展现出卓越的零样本跨语言迁移能力。尽管这些结果令人鼓舞,但后续研究发现,在多语言嵌入空间中存在强烈的语言身份信息,这阻碍了跨语言共享的语言因素的表达。对于跨语言句子检索等语义任务,期望消除此类语言身份信号以充分利用语义信息。在这项工作中,我们提供了一种从多语言嵌入空间中投影掉语言特定因素的新视角。具体而言,我们发现存在一个主要编码与语义无关信息(例如句法信息)的低秩子空间。为识别该子空间,我们提出了一种简单但有效的无监督方法,该方法基于以多个单语语料库为输入的奇异值分解。一旦找到该子空间,我们可以直接将原始嵌入投影到零空间中以增强语言无关性,而无需微调。我们在包括具有挑战性的语言无关问答检索任务在内的各种任务上系统评估了我们的方法。实证结果表明,应用我们的方法能持续改进常用的 ML-LM。

关键词

引用

@article{arxiv.2401.05792,
  title  = {Discovering Low-rank Subspaces for Language-agnostic Multilingual Representations},
  author = {Zhihui Xie and Handong Zhao and Tong Yu and Shuai Li},
  journal= {arXiv preprint arXiv:2401.05792},
  year   = {2024}
}

备注

17 pages, 7 figures, EMNLP 2022 (main conference)