Neuralogram:一种基于深度神经网络的音频信号表示
声音
2019-04-11 v1 机器学习
多媒体
音频与语音处理
摘要
我们提出Neuralogram——一种基于深度神经网络用于理解音频信号的表示,顾名思义,它通过将音频信号转换为基于经由神经架构学习到的嵌入的稠密、紧凑表示。通过一系列探测信号,我们展示了我们的表示如何封装音高、音色和基于节奏的信息以及其他属性。该表示为揭示任意长音频信号中有意义的关系提供了一种方法,而这些关系尚不能被现有算法很好地表示。这在音频理解、音乐推荐、元数据提取等众多应用中具有潜力。
引用
@article{arxiv.1904.05073,
title = {Neuralogram: A Deep Neural Network Based Representation for Audio Signals},
author = {Prateek Verma and Chris Chafe and Jonathan Berger},
journal= {arXiv preprint arXiv:1904.05073},
year = {2019}
}
备注
Submitted to DAFx 2019, the 22nd International Conference on Digital Audio Effects, Birmingham, United Kingdom