中文

跨模态协同表示学习及面向人群计数的大规模 RGBT 基准数据集

计算机视觉与模式识别 2021-04-07 v2 人工智能

摘要

人群计数是一项基础但具有挑战性的任务,其需要丰富的信息来生成逐像素的人群密度图。然而,以往大多数方法仅使用了 RGB 图像的有限信息,无法在非受限场景中很好地发现潜在行人。在本工作中,我们发现结合光学与热红外信息可以极大地帮助识别行人。为推动该领域的未来研究,我们引入了一个大规模 RGBT 人群计数(RGBT-CC)基准数据集,包含 2,030 对 RGB-热红外图像,标注了 138,389 个人。此外,为促进多模态人群计数,我们提出了一种跨模态协同表示学习框架,该框架由多个模态特定分支、一个模态共享分支以及一个信息聚合-分发模块(IADM)组成,以充分捕获不同模态的互补信息。具体而言,我们的 IADM 结合了两种协同信息传输,通过双重信息传播机制动态增强模态共享与模态特定的表示。在 RGBT-CC 基准上进行的广泛实验证明了我们的框架在 RGBT 人群计数上的有效性。此外,所提方法对多模态人群计数是通用的,并且也能够在 ShanghaiTechRGBD 数据集上取得优越性能。最后,我们的源代码与基准数据集发布于{\url{http://lingboliu.com/RGBT_Crowd_Counting.html}}。

关键词

引用

@article{arxiv.2012.04529,
  title  = {Cross-Modal Collaborative Representation Learning and a Large-Scale RGBT Benchmark for Crowd Counting},
  author = {Lingbo Liu and Jiaqi Chen and Hefeng Wu and Guanbin Li and Chenglong Li and Liang Lin},
  journal= {arXiv preprint arXiv:2012.04529},
  year   = {2021}
}

备注

Accepted by CVPR2021. Our code and benchmark for RGBT crowd counting are released at {\url{http://lingboliu.com/RGBT_Crowd_Counting.html}}