音频风格迁移
声音
2019-04-29 v3 音频与语音处理
经典物理
摘要
图像间的“风格迁移”近年来随着卷积神经网络(CNNs)的强大能力而迅速成为非常活跃的研究课题,并很快成为社交媒体中非常流行的技术。本文研究音频领域中的类似问题:如何将参考音频信号的风格迁移到目标音频内容?我们针对该任务提出了一个灵活的框架,其使用声音纹理模型提取刻画参考音频风格的统计量,随后通过基于优化的音频纹理合成来修改目标内容。与主流的基于优化的视觉迁移方法不同,所提过程以目标内容而非随机噪声初始化,且优化的损失仅关于纹理而非结构。这些差异在我们的实验中证明是音频风格迁移的关键。为提取感兴趣的特征,我们研究了不同的架构,无论是像图像风格迁移那样在其他任务上预训练的,还是基于人类听觉系统设计的。在不同类型音频信号上的实验结果证实了所提方法的潜力。
引用
@article{arxiv.1710.11385,
title = {Audio style transfer},
author = {Eric Grinstein and Ngoc Duong and Alexey Ozerov and Patrick Pérez},
journal= {arXiv preprint arXiv:1710.11385},
year = {2019}
}
备注
ICASSP 2018 - 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Apr 2018, Calgary, France. IEEE