中文

基于视觉与听觉的重复活动计数

计算机视觉与模式识别 2021-04-20 v2

摘要

本文致力于视频中的重复活动计数。与现有仅分析视觉视频内容的工作不同,我们首次将相应声音引入重复计数过程。这有利于在遮挡、剧烈相机视角变化、低分辨率等挑战性视觉条件下的准确性。我们提出一个模型,首先分别分析视觉与听觉流,然后引入视听时间步长决策模块与可靠性估计模块以利用跨模态时间交互。为学习与评估,我们对现有数据集进行重新利用与重组,以支持基于视觉与听觉的重复计数。我们还引入了该数据集的一个变体,用于挑战性视觉条件下的重复计数。实验证明了声音以及其他所引入模块对重复计数的益处。仅使用视觉的模型本身已优于当前最优方法,加入声音后结果显著提升,尤其在恶劣视觉条件下。

关键词

引用

@article{arxiv.2103.13096,
  title  = {Repetitive Activity Counting by Sight and Sound},
  author = {Yunhua Zhang and Ling Shao and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:2103.13096},
  year   = {2021}
}

备注

Accepted at CVPR 2021