基于自编码器的快速实时音频风格迁移架构
声音
2018-12-27 v2 机器学习
音频与语音处理
机器学习
摘要
近来,音频风格迁移领域引起了极大兴趣,其通过将参考音频的风格施加于目标音频的内容来生成风格化音频。我们改进了当前使用神经网络提取音频信号内容与风格的方法,并提出了一种用于该任务的新基于自编码器的架构。该网络在单次前向传播中为内容音频生成风格化音频。所提出的网络架构在生成音频的质量与训练网络所需时间上均表现出优势。该网络在语音信号上进行了实验,以确认我们提案的有效性。
引用
@article{arxiv.1812.07159,
title = {Autoencoder Based Architecture For Fast & Real Time Audio Style Transfer},
author = {Dhruv Ramani and Samarjit Karmakar and Anirban Panda and Asad Ahmed and Pratham Tangri},
journal= {arXiv preprint arXiv:1812.07159},
year = {2018}
}