中文

以字节为单位度量跨语言迁移

计算与语言 2024-04-15 v1

摘要

多语言预训练一直是应对语言资源缺乏挑战的成功解决方案。这些模型能够在只有极少或没有示例的情况下将知识迁移到目标语言。近期研究表明,单语模型也具有类似能力,但这种迁移背后的机制仍不清楚。一些研究探讨了语言污染和句法相似性等因素。一个新兴的研究方向表明,语言模型学习到的表示包含两个部分:特定语言部分和语言无关部分。后者负责迁移更普遍的知识。然而,目前缺乏在多样化目标语言中对这些属性的全面探索。为验证这一假设,我们受迁移缩放定律相关工作的启发进行了一项实验。我们度量了从源语言迁移到目标语言的数据量,并发现在跨语言设置下,以不同语言初始化的模型在目标语言上的表现相似。这令人惊讶,因为迁移到西班牙语、韩语和芬兰语等10种不同目标语言的数据量非常接近。我们还发现了证据表明这种迁移与语言污染或语言接近度无关,这强化了模型也依赖语言无关知识的假设。我们的实验为度量有多少数据代表了预训练期间学习到的语言无关表示开辟了新的可能性。

关键词

引用

@article{arxiv.2404.08191,
  title  = {Measuring Cross-lingual Transfer in Bytes},
  author = {Leandro Rodrigues de Souza and Thales Sales Almeida and Roberto Lotufo and Rodrigo Nogueira},
  journal= {arXiv preprint arXiv:2404.08191},
  year   = {2024}
}

备注

NAACL 2024