中文

PnP-DETR:面向高效视觉分析的 Transformer 方法

计算机视觉与模式识别 2022-03-03 v4

摘要

近来,DETR 开创了用 transformers 解决视觉任务的方案,它直接将图像特征图转换为目标检测结果。尽管有效,但由于对背景等某些区域进行冗余计算,转换完整特征图可能代价高昂。本工作中,我们将减少空间冗余的思想封装为一个新颖的轮询与池化(PnP)采样模块,并由此构建了一个端到端的 PnP-DETR 架构,其自适应地在空间上分配计算从而更为高效。具体而言,PnP 模块将图像特征图抽象为精细的前景目标特征向量和少量的粗粒度背景上下文特征向量。transformer 在精细-粗粒度特征空间内建模信息交互,并将特征转换为检测结果。此外,通过变化采样特征长度,PnP 增强的模型可用单一模型即时实现性能与计算之间的多种所需权衡,而无需像现有方法那样训练多个模型。因此,它为在具有不同计算约束的多样场景中部署提供了更大灵活性。我们进一步在全景分割和近期基于 transformer 的图像识别模型 ViT 上验证了 PnP 模块的通用性,并显示出一致的效率提升。我们相信我们的方法为基于 transformers 的高效视觉分析(其中空间冗余普遍可见)迈出了一步。代码将发布于 \url{https://github.com/twangnh/pnp-detr}。

关键词

引用

@article{arxiv.2109.07036,
  title  = {PnP-DETR: Towards Efficient Visual Analysis with Transformers},
  author = {Tao Wang and Li Yuan and Yunpeng Chen and Jiashi Feng and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2109.07036},
  year   = {2022}
}

备注

accepted by ICCV 2021