融合时空上下文的多模态城市声音标注
音频与语音处理
2023-11-22 v2
摘要
噪声污染显著影响我们的日常生活与城市发展。城市声音标注(UST)近来备受关注,其旨在分析与监测城市噪声污染。以往UST研究的不足之一在于,声音信号的时空上下文——包含关于音频数据录制时间与地点的互补信息——尚未被探究。为解决此问题,本文提出一种多模态UST系统,深度挖掘音频与时空上下文的联合信息。为融合不同声学特征的特性,首先提取两组各四张频谱图作为残差神经网络的输入。随后,将时空上下文编码并与声学特征结合,以探索多模态学习在区分声音信号上的效能。此外,在文本处理中采用数据过滤方法进一步提升多模态性能。我们在DCASE2020的UST挑战赛(任务5)上评估所提方法。实验结果证明了该方法的有效性。
引用
@article{arxiv.2011.00175,
title = {Multimodal Urban Sound Tagging with Spatiotemporal Context},
author = {Jisheng Bai and Jianfeng Chen and Mou Wang},
journal= {arXiv preprint arXiv:2011.00175},
year = {2023}
}