中文

用于单图像目标检测的上下文增强Transformer

计算机视觉与模式识别 2023-12-27 v2

摘要

随着视频数据在实际应用中的重要性日益增加,对利用时间信息的高效目标检测方法的需求也在上升。现有的视频目标检测(VOD)技术采用各种策略来应对这一挑战,但它们通常依赖于局部相邻帧或片段内随机采样的图像。尽管最近基于Transformer的VOD方法显示出有希望的结果,但它们对多个输入和额外网络复杂性的依赖限制了其实用性。在本文中,我们提出了一种新颖的单图像目标检测方法,称为上下文增强Transformer(CETR),通过使用新设计的内存模块将时间上下文融入DETR。为了高效存储时间信息,我们构建了一个类级内存,跨数据收集上下文信息。此外,我们提出了一种基于分类的采样技术,以选择性地利用与当前图像相关的内存。在测试中,我们引入了一种测试时内存自适应方法,通过考虑测试分布来更新各个内存函数。在CityCam和ImageNet VID数据集上的实验展示了该框架在各种视频系统上的效率。项目页面和代码将在https://ku-cvlab.github.io/CETR提供。

关键词

引用

@article{arxiv.2312.14492,
  title  = {Context Enhanced Transformer for Single Image Object Detection},
  author = {Seungjun An and Seonghoon Park and Gyeongnyeon Kim and Jeongyeol Baek and Byeongwon Lee and Seungryong Kim},
  journal= {arXiv preprint arXiv:2312.14492},
  year   = {2023}
}

备注

Project page: https://ku-cvlab.github.io/CETR