中文

用于卷积神经网络处理的音频频谱图表示

声音 2017-06-30 v1 机器学习 多媒体 神经与进化计算

摘要

在为任何应用设计神经网络时,需要做出的决策之一是如何表示数据,以便将其呈现给神经网络,并可能由神经网络生成。对于音频而言,这种选择不如视觉图像那样显而易见,并且已有多种表示方法被用于不同的应用,包括原始数字化样本流、手工设计的特征、机器发现的特征、MFCC及其包含差分的变体,以及各种频谱表示。本文回顾了其中一些表示方法及相关问题,特别关注用于风格迁移的神经网络生成音频时的频谱图。

关键词

引用

@article{arxiv.1706.09559,
  title  = {Audio Spectrogram Representations for Processing with Convolutional Neural Networks},
  author = {L. Wyse},
  journal= {arXiv preprint arXiv:1706.09559},
  year   = {2017}
}

备注

Proceedings of the First International Conference on Deep Learning and Music, Anchorage, US, May, 2017 (arXiv:1706.08675v1 [cs.NE])