中文

两种语言模型为何会如此相似?

计算与语言 2024-06-25 v2

摘要

建构差异是否显著影响模型如何表示和处理语言?我们提出一种新方法,基于度量学习编码模型(MLEMs),以此为回答此问题的第一步。该方法提供了如何比较任意两个模型任意两层表示语言信息的特征方法。我们将该方法应用于 BERT、GPT-2 和 Mamba。不同于以往方法,MLEMs 提供透明的比较,通过识别负责相似性和差异性的具体语言特征。更一般地,该方法使用形式化、符号化的领域描述,用于比较神经表示。因此,该方法可以直接扩展到其他领域,如语音和视觉,也可以扩展到其他神经系统,包括人类大脑。

关键词

引用

@article{arxiv.2406.12620,
  title  = {What Makes Two Language Models Think Alike?},
  author = {Jeanne Salle and Louis Jalouzot and Nur Lan and Emmanuel Chemla and Yair Lakretz},
  journal= {arXiv preprint arXiv:2406.12620},
  year   = {2024}
}

备注

7 pages, 6 figures