中文

基于音视觉Transformer的人群计数

计算机视觉与模式识别 2021-09-07 v1

摘要

人群估计是一个极具挑战性的问题。最近的研究尝试利用听觉信息辅助视觉模型,然而由于缺乏有效的特征提取与融合方法,性能受限。本文提出一种新的音视觉多任务网络,通过有效利用视觉与音频输入以实现更好的模态关联和高效特征提取,解决人群计数中的关键挑战。所提网络引入辅助且显式的图像块重要性排序(PIR)和块级人群估计(PCE)信息作为第三种(运行时)模态。这些模态(音频、视觉、运行时)经过受Transformer启发的跨模态协同注意力机制,最终输出人群估计。为获取丰富视觉特征,我们提出具有Transformer风格融合的多分支结构。大量实验评估表明,所提方案在所有评估设置下均优于最先进网络,提升高达33.8%。我们还分析并比较了网络的纯视觉变体,并从经验上证明其优于先前方法。

关键词

引用

@article{arxiv.2109.01926,
  title  = {Audio-Visual Transformer Based Crowd Counting},
  author = {Usman Sajid and Xiangyu Chen and Hasan Sajid and Taejoon Kim and Guanghui Wang},
  journal= {arXiv preprint arXiv:2109.01926},
  year   = {2021}
}