面向拥挤场景分类的视听数据集与深度学习框架
计算机视觉与模式识别
2021-12-20 v1 机器学习
图像与视频处理
摘要
本文提出了一个视听场景分类(SC)任务,其中输入视频被分类为五种现实生活中的拥挤场景之一:'Riot'、'Noise-Street'、'Firework-Event'、'Music-Event' 和 'Sport-Atmosphere'。为此,我们首先从 Youtube(自然场景)收集了这五种拥挤场景的视听数据集(视频)。然后,提出了广泛的深度学习框架来独立部署音频或视觉输入数据。最后,融合来自高性能深度学习框架的结果以获得最佳准确率。我们的实验结果表明,音频和视觉输入因素独立地对 SC 任务的性能做出了贡献。值得注意的是,探索音频或视觉输入数据的深度学习框架集成可以实现 95.7% 的最佳准确率。
引用
@article{arxiv.2112.09172,
title = {An Audio-Visual Dataset and Deep Learning Frameworks for Crowded Scene Classification},
author = {Lam Pham and Dat Ngo and Phu X. Nguyen and Truong Hoang and Alexander Schindler},
journal= {arXiv preprint arXiv:2112.09172},
year = {2021}
}