基于深度学习与两阶段训练策略的日常视频分类多模态系统
声音
2023-05-03 v1 多媒体
音频与语音处理
摘要
在本文中,我们提出一个基于深度学习的多模态系统用于分类日常视频。为训练该系统,我们提出一种两阶段训练策略。在第一训练阶段(阶段 I),我们从原始视频中提取音频和视觉(图像)数据。然后我们用独立的基于深度学习的模型分别训练音频数据和视觉数据。训练过程后,我们通过从预训练深度学习模型提取特征图获得音频嵌入和视觉嵌入。在第二训练阶段(阶段 II),我们训练一个融合层来组合音频/视觉嵌入,并训练一个全连接层将组合嵌入分类到目标日常场景中。我们在 DCASE(IEEE AASP 声学场景与事件检测及分类挑战)2021 Task 1B Development 基准数据集上进行的广泛实验,仅用音频数据、仅用视觉数据、以及同时使用音频和视觉数据分别取得了 80.5%、91.8% 和 95.3% 的最佳分类准确率。95.3% 的最高分类准确率相比 DCASE 基线提升了 17.9%,并展现出与最先进系统极强的竞争力。
引用
@article{arxiv.2305.01476,
title = {Deep Learning Based Multimodal with Two-phase Training Strategy for Daily Life Video Classification},
author = {Lam Pham and Trang Le and Cam Le and Dat Ngo and Weissenfeld Axel and Alexander Schindler},
journal= {arXiv preprint arXiv:2305.01476},
year = {2023}
}