中文

应用于音视觉场景分类的深度学习框架

声音 2021-06-17 v1 音频与语音处理

摘要

本文提出了用于音视觉场景分类(SC)的深度学习框架,并指出了单独的视觉与音频特征及其组合如何影响场景分类性能。我们在 DCASE(IEEE AASP 声学场景与事件检测及分类挑战赛)任务 1B 开发数据集上进行了大量实验,仅使用音频输入、仅使用视觉输入以及同时使用音视觉输入分别取得了 82.2%、91.1% 和 93.9% 的最佳分类准确率。由基于音频和基于视觉的框架集成所获得的 93.9% 最高分类准确率,相比 DCASE 基线提升了 16.5%。

关键词

引用

@article{arxiv.2106.06840,
  title  = {Deep Learning Frameworks Applied For Audio-Visual Scene Classification},
  author = {Lam Pham and Alexander Schindler and Mina Schütz and Jasmin Lampert and Sven Schlarb and Ross King},
  journal= {arXiv preprint arXiv:2106.06840},
  year   = {2021}
}

备注

6 pages