中文

CountFormer:基于多视图人群计数变换器

计算机视觉与模式识别 2024-07-03 v1

摘要

多视图计数(MVC)方法在遮挡严重和视角畸变显著的场景中,显示出优于单视图方法的优势。然而,传统MVC方法中依赖手工制作的启发式特征和相同的相机布局要求,限制了其在实际场景中的适用性和可扩展性。本文提出一种简洁的3D MVC框架,称为CountFormer,通过将多视图图像级特征提升至场景级体积表示,并基于体积特征估计3D密度图。通过引入相机编码策略,CountFormer成功地将相机参数嵌入体积查询和图像级特征,使其能够处理各相机布局差异显著的场景。此外,本文引入一种基于注意力机制的特征升力模块,用于将图像级特征转换为每个相机视图的3D体积表示。随后,多视图体积聚合模块注意性地聚合各种多视图体积,以创建综合的场景级体积表示,使CountFormer能够处理由任意动态相机布局捕获的图像。所提出的方法在多个广泛使用的数据集上均表现优于当前最先进的方法,显示其在实际部署方面比传统MVC框架更合适。

关键词

引用

@article{arxiv.2407.02047,
  title  = {CountFormer: Multi-View Crowd Counting Transformer},
  author = {Hong Mo and Xiong Zhang and Jianchao Tan and Cheng Yang and Qiong Gu and Bo Hang and Wenqi Ren},
  journal= {arXiv preprint arXiv:2407.02047},
  year   = {2024}
}

备注

Accepted By ECCV2024