中文

面向拥挤场景分类的视听数据集与深度学习框架

计算机视觉与模式识别 2021-12-20 v1 机器学习 图像与视频处理

摘要

本文提出了一个视听场景分类(SC)任务,其中输入视频被分类为五种现实生活中的拥挤场景之一:'Riot'、'Noise-Street'、'Firework-Event'、'Music-Event' 和 'Sport-Atmosphere'。为此,我们首先从 Youtube(自然场景)收集了这五种拥挤场景的视听数据集(视频)。然后,提出了广泛的深度学习框架来独立部署音频或视觉输入数据。最后,融合来自高性能深度学习框架的结果以获得最佳准确率。我们的实验结果表明,音频和视觉输入因素独立地对 SC 任务的性能做出了贡献。值得注意的是,探索音频或视觉输入数据的深度学习框架集成可以实现 95.7% 的最佳准确率。

关键词

引用

@article{arxiv.2112.09172,
  title  = {An Audio-Visual Dataset and Deep Learning Frameworks for Crowded Scene Classification},
  author = {Lam Pham and Dat Ngo and Phu X. Nguyen and Truong Hoang and Alexander Schindler},
  journal= {arXiv preprint arXiv:2112.09172},
  year   = {2021}
}