SSGA-Net:面向自动驾驶的分步空间全局-局部聚合网络
计算机视觉与模式识别
2024-05-30 v1
摘要
基于视觉的感知是自动驾驶的关键模块。其中,视频目标检测是由于快速运动或多姿态变化导致特征退化的主要且具有挑战性的任务。当前模型通常从相邻帧聚合特征以增强目标表示,以供任务头部生成更准确的预测。尽管提升了性能,但这些方法依赖于未来帧的信息,且计算复杂度较高。此外,聚合过程在推理期间不可重新配置。这些问题使得大多数现有模型不适用于在线应用。为解决这些问题,我们引入了分步空间全局-局部聚合网络。我们提出的模型主要包含三个部分:1)多阶段分步网络逐步细化预测和目标表示;2)空间全局-局部聚合融合相邻帧的局部信息和当前帧的全局语义,以消除特征退化;3)动态聚合策略基于细化结果提前停止聚合,以消除冗余并提高效率。在ImageNet VID基准上的大量实验验证了我们所提出模型的有效性和效率。
引用
@article{arxiv.2405.18857,
title = {SSGA-Net: Stepwise Spatial Global-local Aggregation Networks for for Autonomous Driving},
author = {Yiming Cui and Cheng Han and Dongfang Liu},
journal= {arXiv preprint arXiv:2405.18857},
year = {2024}
}