中文

Neuralogram:一种基于深度神经网络的音频信号表示

声音 2019-04-11 v1 机器学习 多媒体 音频与语音处理

摘要

我们提出Neuralogram——一种基于深度神经网络用于理解音频信号的表示,顾名思义,它通过将音频信号转换为基于经由神经架构学习到的嵌入的稠密、紧凑表示。通过一系列探测信号,我们展示了我们的表示如何封装音高、音色和基于节奏的信息以及其他属性。该表示为揭示任意长音频信号中有意义的关系提供了一种方法,而这些关系尚不能被现有算法很好地表示。这在音频理解、音乐推荐、元数据提取等众多应用中具有潜力。

关键词

引用

@article{arxiv.1904.05073,
  title  = {Neuralogram: A Deep Neural Network Based Representation for Audio Signals},
  author = {Prateek Verma and Chris Chafe and Jonathan Berger},
  journal= {arXiv preprint arXiv:1904.05073},
  year   = {2019}
}

备注

Submitted to DAFx 2019, the 22nd International Conference on Digital Audio Effects, Birmingham, United Kingdom