音视频场景分类:DCASE 2021 挑战赛提交方案分析
音频与语音处理
2021-07-21 v2 声音
摘要
本文介绍了 DCASE 2021 挑战赛中的音视频场景分类任务(任务 1 子任务 B)的细节。该任务关注利用同步录音数据集进行音频和视频模态的分类。该任务吸引了来自全球 13 个不同团队的 43 份提交。在所有提交中,超过一半的提交系统性能优于基线。顶尖系统的共性技术包括使用大型预训练模型(如 ResNet 或 EfficientNet)针对特定任务问题进行训练。微调、迁移学习和数据增强技术也被用来提升性能。更重要的是,排名前 5 的团队全部采用了同时使用音频和视频的多模态方法。所有提交中最佳系统达到了 0.195 的 logloss 和 93.8% 的准确率,而基线系统的 logloss 为 0.662、准确率为 77.1%。
引用
@article{arxiv.2105.13675,
title = {Audio-visual scene classification: analysis of DCASE 2021 Challenge submissions},
author = {Shanshan Wang and Toni Heittola and Annamaria Mesaros and Tuomas Virtanen},
journal= {arXiv preprint arXiv:2105.13675},
year = {2021}
}