TensorLens:基于高阶注意力张量的端到端 Transformer 分析
机器学习
2026-01-27 v1
摘要
注意力矩阵是 Transformer 研究的基础,支持包括可解释性、可视化、操作和蒸馏在内的广泛应用。然而,大多数现有分析集中于单个注意力头或层,未能刻画模型的全局行为。尽管先前的工作通过平均和矩阵乘法将注意力公式扩展至多个头,或引入归一化和 FFN 等组件,但仍缺乏一个能封装所有 Transformer 模块的统一且完整的表示。我们通过引入 TensorLens 来填补这一空白,这是一种新颖的公式化方法,将整个 Transformer 捕获为一个由高阶注意力交互张量表达的单一且依赖于输入的线性算子。该张量联合编码了注意力、FFN、激活函数、归一化和残差连接,为模型计算提供了理论上连贯且富有表达力的线性表示。TensorLens 具有理论基础,我们的实证验证表明它比以往的注意力聚合方法产生了更丰富的表示。我们的实验表明,注意力张量可以作为开发可解释性与模型理解工具的强大基础。我们的代码作为附件提供。
引用
@article{arxiv.2601.17958,
title = {TensorLens: End-to-End Transformer Analysis via High-Order Attention Tensors},
author = {Ido Andrew Atad and Itamar Zimerman and Shahar Katz and Lior Wolf},
journal= {arXiv preprint arXiv:2601.17958},
year = {2026}
}
备注
17 pages, 7 figures