中文

Fast-COS:基于重参数化注意力 Vision Transformer 的快速单阶段目标检测器,用于自动驾驶

计算机视觉与模式识别 2025-02-12 v1

摘要

感知系统是自动驾驶系统确保安全的关键环节。驾驶场景的感知系统本质上代表了一个目标检测任务,需要在准确性和处理速度之间取得平衡。许多当代方法侧重于提高检测准确性,但往往忽视了在计算资源有限的情况下的实时检测能力的重要性。因此,调查高效的目标检测策略对于驾驶场景至关重要。本文提出 Fast-COS,这是一个专为驾驶场景应用量身打造的新型单阶段目标检测框架。本研究首先对 backbone 进行分析,考虑宏观和微观架构设计,得到重参数化注意力 Vision Transformer (RAViT)。RAViT 利用重参数化多尺度深度可分离卷积 (RepMSDW) 和重参数化自注意力 (RepSA) 以提升计算效率和特征提取。在 GPU、边缘和移动平台上的广泛测试表明,RAViT 在 ImageNet-1K 数据集上实现了 81.4% 的 Top-1 准确率,显著优于类似 backbone 模型如 ResNet、FastViT、RepViT 和 EfficientFormer。在边缘设备上,Fast-COS 集成 RepMSDW 构建 RepFPN,实现快速的多尺度特征融合。Fast-COS 在驾驶场景中提升了目标检测性能,在 BDD100K 数据集上获得 57.2% 的 AP50 分数,在 TJU-DHD 交通数据集上获得 80.0% 的得分。它在效率方面超过领先模型,在 GPU 推理速度上快达 75.9%,在边缘设备吞吐量上高出 1.38 倍。这些发现表明 Fast-COS 是一个高度可扩展且可靠的解决方案,特别适用于资源受限的实时应用,如自动驾驶系统。

关键词

引用

@article{arxiv.2502.07417,
  title  = {Fast-COS: A Fast One-Stage Object Detector Based on Reparameterized Attention Vision Transformer for Autonomous Driving},
  author = {Novendra Setyawan and Ghufron Wahyu Kurniawan and Chi-Chia Sun and Wen-Kai Kuo and Jun-Wei Hsieh},
  journal= {arXiv preprint arXiv:2502.07417},
  year   = {2025}
}

备注

Under Review on IEEE Transactions on Intelligent Transportation Systems