CascadedViT:级联块馈前网络与级联组注意力视觉Transformer
计算机视觉与模式识别
2025-11-25 v2 人工智能
摘要
视觉Transformer(ViT)在多项计算机视觉任务中展现出卓越性能,但其高计算、存储与能耗要求制约了在资源受限平台上的部署。本文提出\emph{Cascaded-ViT(CViT)},一种轻量级且计算高效的视觉Transformer架构,特点是 novel feedforward 网络设计称为\emph{级联块馈前网络(CCFFN)}。通过分割输入特征,CCFFN 在不牺牲精度的前提下提升参数与 FLOP 效率。在 ImageNet-1K 上实验表明,\emph{CViT-XL} 模型实现 75.5% 的 Top-1 准确率,同时将 FLOP 降低 15%,能耗降低 3.3%,优于 EfficientViT-M5。跨各模型规模,CViT 系列始终拥有最低能耗,适用于移动电话与无人机等电池受限设备。此外,本文提出的新指标\emph{准确率-每FLOP(APF)},量化计算效率相对于精度的表现,CViT 模型在该指标下始终名列前茅。尤其,CViT-L 比 EfficientViT-M2 多准确 2.2%,而 APF 分数相当。
引用
@article{arxiv.2511.14111,
title = {CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer},
author = {Srivathsan Sivakumar and Faisal Z. Qureshi},
journal= {arXiv preprint arXiv:2511.14111},
year = {2025}
}