基于精简自监督语音表征的低资源跨领域歌声合成
声音
2024-02-05 v1 机器学习
音频与语音处理
摘要
本文提出了一种歌声合成模型 Karaoker-SSL,该模型仅使用文本和语音数据作为典型的多说话人声学模型进行训练。这是一个低资源流程,其声码器也仅用语音数据训练,因此端到端不利用任何歌唱数据。Karaoker-SSL 以无监督方式由自监督语音表征进行条件控制。我们通过仅选择这些表征中与任务相关的维度子集来对其进行预处理。在训练过程中,条件模块通过多任务学习被间接引导以捕获风格信息。这是通过一个基于 Conformer 的模块实现的,该模块根据声学模型的输出预测音高。因此,Karaoker-SSL 允许在不依赖手工制作和特定领域特征的情况下进行歌声合成,同时也不要求文本对齐或歌词时间戳。为了改善声音质量,我们采用了一个 U-Net 判别器,该判别器以目标说话人为条件,并遵循 Diffusion GAN 训练方案。
引用
@article{arxiv.2402.01520,
title = {Low-Resource Cross-Domain Singing Voice Synthesis via Reduced Self-Supervised Speech Representations},
author = {Panos Kakoulidis and Nikolaos Ellinas and Georgios Vamvoukakis and Myrsini Christidou and Alexandra Vioni and Georgia Maniati and Junkwang Oh and Gunu Jho and Inchul Hwang and Pirros Tsiakoulis and Aimilios Chalamandaris},
journal= {arXiv preprint arXiv:2402.01520},
year = {2024}
}
备注
Accepted to IEEE ICASSP SASB 2024