中文

学习的形态:基于 Transformer 模型的各向异性与内在维度

计算与语言 2024-02-27 v2 人工智能 信息论 机器学习 一般拓扑 math.IT

摘要

在本研究中,我们针对编码器与解码器之间的二分差异,对 transformer 架构中嵌入向量的各向异性动态与内在维度进行了探究。我们的发现表明,transformer 解码器中的各向异性分布呈现明显的钟形曲线,各向异性浓度在中部层最高。该模式不同于编码器中观察到的更均匀分布的各向异性。此外,我们发现嵌入向量的内在维度在训练初期增加,表明向更高维空间扩展;随后在训练末期出现维度下降的压缩阶段,意味着精炼为更紧凑的表示。我们的结果为理解编码器与解码器嵌入特性提供了新见解。

关键词

引用

@article{arxiv.2311.05928,
  title  = {The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models},
  author = {Anton Razzhigaev and Matvey Mikhalchuk and Elizaveta Goncharova and Ivan Oseledets and Denis Dimitrov and Andrey Kuznetsov},
  journal= {arXiv preprint arXiv:2311.05928},
  year   = {2024}
}

备注

Accepted to EACL-2024