CoCAViT: 具备鲁棒全局协调的紧凑型视觉 Transformer
计算机视觉与模式识别
2025-08-08 v1
摘要
近年来,大规模视觉主干网络通过大规模预训练展示出在从图像中学习通用特征方面的显著能力。同时,许多高效架构涌现,其在领域内基准测试方面的性能相当于大型模型。然而,我们注意到对于较小的模型,在分布外(OOD)数据上的性能下降比例更大,这表明现有高效模型的泛化性能存在不足。为此,我们识别出关键的架构瓶颈和不恰当的设计选择,这些因素导致此问题,同时保留较小模型的鲁棒性。为恢复纯窗口注意力的全局感受野,我们进一步引入了Coordinator-patch 跨注意力(CoCA)机制,采用动态、领域感知的全局标记来增强局部-全局特征建模,并在最小计算开销下适应性地捕获跨域的鲁棒模式。整合这些进展,我们提出CoCAViT,这是一种为具备鲁棒性的实时视觉表示而设计的新型视觉主干。大量实验经验性地验证了我们的设计。在224×224的分辨率下,CoCAViT-28M在ImageNet-1K上实现84.0%的顶级1准确率,并在多个OOD基准测试中实现显著提升。它还在COCO目标检测上实现52.2 mAP,在ADE20K语义分割上实现51.3 mIOU,同时保持低延迟。
引用
@article{arxiv.2508.05307,
title = {CoCAViT: Compact Vision Transformer with Robust Global Coordination},
author = {Xuyang Wang and Lingjuan Miao and Zhiqiang Zhou},
journal= {arXiv preprint arXiv:2508.05307},
year = {2025}
}