中文

CascadedViT:级联块馈前网络与级联组注意力视觉Transformer

计算机视觉与模式识别 2025-11-25 v2 人工智能

摘要

视觉Transformer(ViT)在多项计算机视觉任务中展现出卓越性能,但其高计算、存储与能耗要求制约了在资源受限平台上的部署。本文提出\emph{Cascaded-ViT(CViT)},一种轻量级且计算高效的视觉Transformer架构,特点是 novel feedforward 网络设计称为\emph{级联块馈前网络(CCFFN)}。通过分割输入特征,CCFFN 在不牺牲精度的前提下提升参数与 FLOP 效率。在 ImageNet-1K 上实验表明,\emph{CViT-XL} 模型实现 75.5% 的 Top-1 准确率,同时将 FLOP 降低 15%,能耗降低 3.3%,优于 EfficientViT-M5。跨各模型规模,CViT 系列始终拥有最低能耗,适用于移动电话与无人机等电池受限设备。此外,本文提出的新指标\emph{准确率-每FLOP(APF)},量化计算效率相对于精度的表现,CViT 模型在该指标下始终名列前茅。尤其,CViT-L 比 EfficientViT-M2 多准确 2.2%,而 APF 分数相当。

关键词

引用

@article{arxiv.2511.14111,
  title  = {CascadedViT: Cascaded Chunk-FeedForward and Cascaded Group Attention Vision Transformer},
  author = {Srivathsan Sivakumar and Faisal Z. Qureshi},
  journal= {arXiv preprint arXiv:2511.14111},
  year   = {2025}
}