中文

用于音视频场景分析的精选城市场景数据集

音频与语音处理 2021-02-12 v2

摘要

本文介绍了一个用于音视频场景分析的精选城市场景数据集,其由精心挑选和录制的素材组成。数据使用相同设备在欧洲多个城市的每个场景的多个位置录制,并且公开可用。我们还展示了一个音视频场景识别的案例研究,表明与最先进的单模态系统相比,音频和视觉模态的联合建模带来了显著的性能提升。我们的方法获得了 84.8% 的准确率,而仅音频和仅视频的等效系统分别为 75.8% 和 68.4%。

关键词

引用

@article{arxiv.2011.00030,
  title  = {A Curated Dataset of Urban Scenes for Audio-Visual Scene Analysis},
  author = {Shanshan Wang and Annamaria Mesaros and Toni Heittola and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2011.00030},
  year   = {2021}
}

备注

accepted by ICASSP 2021