用于声学场景分类的跨模态频谱变换网络
声音
2021-08-17 v1 音频与语音处理
摘要
具有对数梅尔谱特征的卷积神经网络(CNNs)在声学场景分类任务中已显示出有前景的结果。然而,这些基于CNN的分类器性能仍然不足,因为它们对未知环境的泛化能力不佳。为解决此问题,我们引入了一种声学频谱变换网络,其中传统的对数梅尔谱被变换为想象视觉特征(IVF)。想象视觉特征通过利用视频记录中存在的音频与视觉特征之间的关系来学习。自动编码器用于将图像编码为视觉特征,而变换网络学习如何从对数梅尔谱生成想象视觉特征。我们的模型在大型Youtube视频数据集上训练。我们在DCASE和ESC-50的场景分类任务上测试了所提方法,该方法优于其他频谱特征,尤其在未见环境中。
引用
@article{arxiv.2108.06401,
title = {Cross-modal Spectrum Transformation Network For Acoustic Scene classification},
author = {Yang Liu and Alexandros Neophytou and Sunando Sengupta and Eric Sommerlade},
journal= {arXiv preprint arXiv:2108.06401},
year = {2021}
}