大型 Transformer 模型隐藏表示的几何结构
机器学习
2023-10-31 v2 人工智能
机器学习
摘要
大型 transformer 是用于跨多种数据类型(包括蛋白质序列、图像和文本)进行自监督数据分析的强大架构。在这些模型中,数据集的语义结构源于一个表示到下一个表示之间的一系列变换。我们刻画了这些表示的几何与统计性质,以及它们随层推进而发生的变化。通过分析本征维数(ID)与邻域构成,我们发现,在蛋白质语言任务和图像重建任务上训练的 transformer 中,表示的演化方式相似。在前几层,数据流形扩张,变得高维,随后在中间层显著收缩。在模型的最后部分,ID 大致保持恒定或形成第二个浅峰。我们表明,数据集的语义信息在第一个峰值末端表达得更好,并且这一现象可在许多基于不同数据集训练的模型中观察到。基于我们的发现,我们指出一种显式策略,用于在无监督情况下识别使语义内容最大化的层:对应于 ID 轮廓相对极小值的中间层表示更适于下游学习任务。
引用
@article{arxiv.2302.00294,
title = {The geometry of hidden representations of large transformer models},
author = {Lucrezia Valeriani and Diego Doimo and Francesca Cuturello and Alessandro Laio and Alessio Ansuini and Alberto Cazzaniga},
journal= {arXiv preprint arXiv:2302.00294},
year = {2023}
}