学习的形态:基于 Transformer 模型的各向异性与内在维度
计算与语言
2024-02-27 v2 人工智能
信息论
机器学习
一般拓扑
math.IT
摘要
在本研究中,我们针对编码器与解码器之间的二分差异,对 transformer 架构中嵌入向量的各向异性动态与内在维度进行了探究。我们的发现表明,transformer 解码器中的各向异性分布呈现明显的钟形曲线,各向异性浓度在中部层最高。该模式不同于编码器中观察到的更均匀分布的各向异性。此外,我们发现嵌入向量的内在维度在训练初期增加,表明向更高维空间扩展;随后在训练末期出现维度下降的压缩阶段,意味着精炼为更紧凑的表示。我们的结果为理解编码器与解码器嵌入特性提供了新见解。
引用
@article{arxiv.2311.05928,
title = {The Shape of Learning: Anisotropy and Intrinsic Dimensions in Transformer-Based Models},
author = {Anton Razzhigaev and Matvey Mikhalchuk and Elizaveta Goncharova and Ivan Oseledets and Denis Dimitrov and Andrey Kuznetsov},
journal= {arXiv preprint arXiv:2311.05928},
year = {2024}
}
备注
Accepted to EACL-2024