TGBFormer:用于视频目标检测的 Transformer-GraphFormer 混合网络
计算机视觉与模式识别
2025-05-13 v2 人工智能
摘要
近年来,得益于卷积神经网络(CNN)和视觉 Transformer(ViT),视频目标检测取得了显著进展。通常,CNN 擅长捕获局部特征,但在建模全局表征方面存在困难。相反,ViT 善于捕获长程全局特征,但在表示局部特征细节方面面临挑战。现成的视频目标检测方法仅依赖 CNN 或 ViT 进行特征聚合,这限制了它们同时利用全局和局部信息的能力,从而导致检测性能受限。本文提出了一种用于视频目标检测的 Transformer-GraphFormer 混合网络(TGBFormer),通过三项关键技术改进充分利用 Transformer 和图卷积网络的优势,同时弥补其局限性。首先,我们开发了一个时空 Transformer 模块来聚合全局上下文信息,构建具有长程特征依赖的全局表征。其次,我们引入了一个时空 GraphFormer 模块,利用局部空间和时间关系来聚合特征,生成与 Transformer 输出互补的新局部表征。第三,我们设计了一个全局-局部特征混合模块,以自适应地耦合基于 Transformer 的全局表征和基于 GraphFormer 的局部表征。大量实验表明,我们的 TGBFormer 在 ImageNet VID 数据集上取得了新的最先进结果。特别地,我们的 TGBFormer 在单块 Tesla A100 GPU 上以约 41.0 FPS 的速度达到了 86.5% mAP。
引用
@article{arxiv.2503.13903,
title = {TGBFormer: Transformer-GraphFormer Blender Network for Video Object Detection},
author = {Qiang Qi and Xiao Wang},
journal= {arXiv preprint arXiv:2503.13903},
year = {2025}
}
备注
Accepted by AAAI2025