中文

PTSEFormer:面向视频目标检测的渐进时空增强 Transformer

计算机视觉与模式识别 2022-09-07 v1 人工智能

摘要

近年来,应用上下文帧提升目标检测性能已成为视频目标检测的趋势。现有方法通常一次性聚合特征以增强特征,然而这些方法常缺乏来自邻帧的空间信息且存在特征聚合不足的问题。为解决这些问题,我们采用渐进方式引入时序信息与空间信息以实现集成增强。时序信息由时序特征聚合模型(TFAM)通过上下文帧与目标帧(即待检测帧)间的注意力机制引入。同时,我们采用空间转移感知模型(STAM)传递各上下文帧与目标帧间的位置转移信息。基于 Transformer 检测器 DETR 构建的 PTSEFormer 同样遵循端到端方式,避免繁重的后处理流程,同时在 ImageNet VID 数据集上达到 88.1% mAP。代码见 https://github.com/Hon-Wong/PTSEFormer。

关键词

引用

@article{arxiv.2209.02242,
  title  = {PTSEFormer: Progressive Temporal-Spatial Enhanced TransFormer Towards Video Object Detection},
  author = {Han Wang and Jun Tang and Xiaodong Liu and Shanyan Guan and Rong Xie and Li Song},
  journal= {arXiv preprint arXiv:2209.02242},
  year   = {2022}
}