重新思考基于Transformer的语义分割解码器:一种压缩视角
计算机视觉与模式识别
2025-10-10 v4 机器学习
摘要
最先进的基于Transformer的语义分割方法通常采用Transformer解码器,这些解码器通过交叉注意力从图像嵌入中提取额外嵌入,通过自注意力细化其中一种或两种嵌入,并通过点积将图像嵌入投影到额外嵌入上。尽管取得了显著成功,但这些经验性设计仍然缺乏理论依据或解释,从而阻碍了潜在的原则性改进。在本文中,我们认为语义分割与压缩之间存在基本联系,特别是Transformer解码器与主成分分析(PCA)之间的联系。从这个视角出发,我们推导出一个白盒的、全注意力的原则性语义分割解码器(DEPICT),其解释如下:1)自注意力算子细化图像嵌入,以构建一个与监督对齐并保留大部分信息的理想主子空间;2)交叉注意力算子寻求找到细化后图像嵌入的低秩近似,该近似预期是主子空间的一组标准正交基,并对应于预定义的类别;3)点积操作为图像嵌入生成用于分割掩码的紧凑表示。在ADE20K数据集上进行的实验发现,DEPICT始终优于其黑盒对应物Segmenter,并且轻量且更鲁棒。
引用
@article{arxiv.2411.03033,
title = {Rethinking Decoders for Transformer-based Semantic Segmentation: A Compression Perspective},
author = {Qishuai Wen and Chun-Guang Li},
journal= {arXiv preprint arXiv:2411.03033},
year = {2025}
}
备注
NeurIPS2024. Code:https://github.com/QishuaiWen/DEPICT/