中文

通过解耦位置与上下文揭示 Transformer 中的隐藏几何结构

机器学习 2024-02-06 v2 人工智能 机器学习

摘要

Transformer 被广泛用于从输入词元中提取语义,但它们通常作为黑盒模型运行。在本文中,我们提出了一种简单而信息丰富的分解方法,将训练好的 Transformer 的隐藏状态(或嵌入)分解为可解释的组件。对于任意层,输入序列样本的嵌入向量由张量 hRC×T×d\boldsymbol{h} \in \mathbb{R}^{C \times T \times d} 表示。给定序列(或上下文)cCc \le C 中序列位置 tTt \le T 处的嵌入向量 hc,tRd\boldsymbol{h}_{c,t} \in \mathbb{R}^d,提取均值效应得到分解 hc,t=μ+post+ctxc+residc,t \boldsymbol{h}_{c,t} = \boldsymbol{\mu} + \mathbf{pos}_t + \mathbf{ctx}_c + \mathbf{resid}_{c,t} 其中 μ\boldsymbol{\mu} 是全局均值向量,post\mathbf{pos}_tctxc\mathbf{ctx}_c 分别是跨上下文和跨位置的均值向量,residc,t\mathbf{resid}_{c,t} 是残差向量。对于流行的 Transformer 架构和多样化的文本数据集,我们通过经验发现了普遍的数学结构:(1)(post)t(\mathbf{pos}_t)_{t} 在各层形成低维、连续且常为螺旋形的形状,(2)(ctxc)c(\mathbf{ctx}_c)_c 显示出清晰的聚类结构,可归入上下文主题,(3)(post)t(\mathbf{pos}_t)_{t}(ctxc)c(\mathbf{ctx}_c)_c 相互近乎正交。我们认为平滑性在语言训练的 Transformer 中是普遍且有益的,并且我们的分解提高了模型的可解释性。

关键词

引用

@article{arxiv.2310.04861,
  title  = {Uncovering hidden geometry in Transformers via disentangling position and context},
  author = {Jiajun Song and Yiqiao Zhong},
  journal= {arXiv preprint arXiv:2310.04861},
  year   = {2024}
}

备注

38 pages, 34 figures