用于卷积神经网络处理的音频频谱图表示
声音
2017-06-30 v1 机器学习
多媒体
神经与进化计算
摘要
在为任何应用设计神经网络时,需要做出的决策之一是如何表示数据,以便将其呈现给神经网络,并可能由神经网络生成。对于音频而言,这种选择不如视觉图像那样显而易见,并且已有多种表示方法被用于不同的应用,包括原始数字化样本流、手工设计的特征、机器发现的特征、MFCC及其包含差分的变体,以及各种频谱表示。本文回顾了其中一些表示方法及相关问题,特别关注用于风格迁移的神经网络生成音频时的频谱图。
引用
@article{arxiv.1706.09559,
title = {Audio Spectrogram Representations for Processing with Convolutional Neural Networks},
author = {L. Wyse},
journal= {arXiv preprint arXiv:1706.09559},
year = {2017}
}
备注
Proceedings of the First International Conference on Deep Learning and Music, Anchorage, US, May, 2017 (arXiv:1706.08675v1 [cs.NE])