基于音视频风格迁移的语音老化
声音
2021-10-07 v1 计算与语言
机器学习
音频与语音处理
摘要
人脸老化技术已使用生成对抗网络(GANs)和风格迁移学习将人的外观变换得更年轻/更老。这些生成网络通过以源内容的学习向量表示为条件来保持身份。本工作中,我们采用类似方法对说话人的语音进行老化,称为语音老化。我们首先通过在 Common Voice 和 VoxCeleb 数据集上以说话人的语音和人脸数据训练卷积神经网络(CNN)来分析说话人年龄的分类。我们通过风格迁移生成老化语音,将输入谱图变换至不同年龄段,并在移动应用中演示了我们的方法。
引用
@article{arxiv.2110.02411,
title = {Voice Aging with Audio-Visual Style Transfer},
author = {Justin Wilson and Sunyeong Park and Seunghye J. Wilson and Ming C. Lin},
journal= {arXiv preprint arXiv:2110.02411},
year = {2021}
}