中文

多语言表征跨语言相似性的再审视

计算与语言 2022-12-06 v1 人工智能 机器学习

摘要

已有研究使用 CKA 及 CCA 的变体等指标来衡量多语言语言模型中跨语言表征的相似性。在本文中,我们认为 CKA/CCA 的假设与跨语言学习分析的一个核心动机目标(即解释零样本跨语言迁移)并不契合。我们指出这些指标未能捕捉到跨语言相似性的哪些有价值方面,并提供了一个动机性的案例研究,从经验上展示该问题。随后,我们引入“平均神经元级相关性(ANC)”作为一种直接的替代方案,它避免了 CKA/CCA 的困难,并且特别适用于跨语言场景。最后,我们利用 ANC 构建证据,表明先前提出的“先对齐,再预测”模式不仅出现在掩码语言模型(MLM)中,也出现在具有因果语言建模(CLM)目标的多语言模型中。此外,我们表明该模式可扩展到 MLM 和 CLM 的放大版本(最高达原始 mBERT 的 85 倍)。\footnote{我们的代码公开于 \url{https://github.com/TartuNLP/xsim}}

关键词

引用

@article{arxiv.2212.01924,
  title  = {Cross-lingual Similarity of Multilingual Representations Revisited},
  author = {Maksym Del and Mark Fishel},
  journal= {arXiv preprint arXiv:2212.01924},
  year   = {2022}
}

备注

Accepted at AACL 2022