将视觉域风格迁移与纹理合成技术应用于音频——洞见与挑战
声音
2020-08-10 v1 音频与语音处理
摘要
风格迁移是一种基于深度学习神经网络架构中的激活与特征统计量来组合两幅图像的技术。本文研究了音频域中的类似任务,并批判性地审视了将原始基于视觉的框架适配以处理频谱图表示时所出现的问题。我们得出结论:基于二维表示与卷积、具有特征特征的 CNN 架构更适用于视觉图像,而非音频的时频表示。尽管适配并不自然,实验表明,由 Gram 矩阵所确定的音频“风格”更贴近于无时间结构的音色特征,而决定音频“内容”的网络层活动似乎更多地捕捉了音高与节奏结构。我们通过示例阐明了造成这种域差异的若干原因。我们主张使用若干类一维 CNN,其生成的结果比基于现有为图像构建的架构更贴合对音频纹理的直观认知。这些想法也促使我们探索音频纹理合成,借助架构变体扩展至无限纹理、多纹理、感受野的参数化控制,以及以常-Q 变换作为频谱图的替代频率刻度。
引用
@article{arxiv.1901.10240,
title = {Applying Visual Domain Style Transfer and Texture Synthesis Techniques to Audio - Insights and Challenges},
author = {M. Huzaifah and L. Wyse},
journal= {arXiv preprint arXiv:1901.10240},
year = {2020}
}
备注
Post-peer-review, pre-copyedit version of an article to be published in Neural Computing and Applications. 11 figures