CAViT——面向动态特征融合的通道感知 Vision Transformer
摘要
Vision Transformer(ViTs)通过自注意力机制建模长程空间互动,在计算机视觉任务中展现出强大的性能。然而,ViTs 中的通道级混合仍然是静态的,依赖于固定的多层感知器(MLP),缺乏对输入内容的适应性。我们引入 CAViT,一种双注意力架构,用基于注意力的机制取代静态 MLP,以实现特征互动。CAViT 的每个 Transformer 块依次执行空间自注意力和通道自注意力,使模型能够基于全局图像上下文动态校准特征表示。这种统一且内容感知的 token 混合策略,在不增加深度或复杂度的前提下,提升了表征表达性。我们在覆盖自然图像和医学影像等五个基准数据集上验证了 CAViT,准确率较标准 ViT baseline 提升最高可达 +3.6%,同时参数数量和 FLOPs 降低超过 30%。定性注意力图显示,注意力激活模式更锐利且语义更具含义,验证了基于注意力驱动的 token 混合有效性。
引用
@article{arxiv.2602.05598,
title = {CAViT -- Channel-Aware Vision Transformer for Dynamic Feature Fusion},
author = {Aon Safdar and Mohamed Saadeldin},
journal= {arXiv preprint arXiv:2602.05598},
year = {2026}
}
备注
Presented at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2025 (CVPR 25) in the 4th Workshop on Transformers for Visions - T4V (https://sites.google.com/view/t4v-cvpr25/) Accepted for Publication at 33rd International Conference on Artificial Intelligence and Cognitive Science (AICS 2025), where it was shortlisted for Best Paper Award. (https://aicsconf.org/?page_id=278)