基于MCR2目标解耦成员-子空间建模的可解释稀疏线性注意力
计算机视觉与模式识别
2026-01-27 v1 人工智能
摘要
以MCR2(Maximal Coding Rate Reduction)为驱动的白箱变换器,基于结构化表示学习,统一了可解释性和效率,为视觉建模提供可靠的白箱解决方案。然而,在现有设计中,MCR2中“成员矩阵”与“子空间矩阵U”之间的紧密耦合会导致在错误的token投影下产生冗余编码。为此,我们在MCR2目标中解耦“成员矩阵”与“子空间U”之间的功能关系,从而从 unrolled 的梯度下降中推导出可解释的稀疏线性注意力算子。具体而言,我们提议直接从输入中学习成员矩阵,然后从完整空间S中推导出稀疏子空间。因此,对优化MCR2目标的梯度展开会产生一个可解释的稀疏线性注意力算子:解耦成员-子空间注意力(Decoupled Membership-Subspace Attention, DMSA)。在视觉任务上的实验结果表明,仅将Token Statistics Transformer(ToST)中的注意力模块替换为DMSA(我们称之为DMST),不仅实现了更快的编码降低率,而且在ImageNet-1K数据集上以1.08%-1.45%的提升在top-1准确率上超越ToST。与原始Transformer架构相比,DMST在计算效率和可解释性方面表现出显著的优势。
引用
@article{arxiv.2601.17042,
title = {Interpretable and Sparse Linear Attention with Decoupled Membership-Subspace Modeling via MCR2 Objective},
author = {Tianyuan Liu and Libin Hou and Linyuan Wang and Bin Yan},
journal= {arXiv preprint arXiv:2601.17042},
year = {2026}
}
备注
8 pages with 6 figures