MM-TTS:基于多模态提示的富有表现力的语音合成风格迁移
音频与语音处理
2024-02-01 v4 声音
摘要
文本到语音中的风格迁移任务是指将风格信息融入文本内容以生成具有特定风格语音的过程。然而,现有的多数风格迁移方法要么基于固定的情感标签,要么基于参考语音片段,无法实现灵活的风格迁移。最近,一些方法采用文本描述来指导风格迁移。在本文中,我们提出了一种更灵活的多模态风格可控 TTS 框架,名为 MM-TTS。它可以在统一的多模态提示空间中利用任何模态作为提示,包括参考语音、情感面部图像和文本描述,以在系统中控制生成语音的风格。对这种多模态风格可控 TTS 进行建模的挑战主要在于两个方面:1)将多模态信息对齐到统一的风格空间,以支持在单一系统中输入任意模态作为风格提示;2)将统一风格表示高效迁移到给定文本内容中,从而赋予其生成与提示风格相关语音的能力。为了解决这些问题,我们提出了一种对齐的多模态提示编码器,将不同模态嵌入到统一的风格空间中,支持不同模态的风格迁移。此外,我们提出了一种名为 Style Adaptive Convolutions 的新型自适应风格迁移方法,以实现更好的风格表示。进一步地,我们设计了基于 Rectified Flow 的 Refiner 来解决 Mel 频谱图过度平滑的问题,并生成更高保真度的音频。由于目前没有多模态 TTS 的公开数据集,我们构建了一个名为 MEAD-TTS 的数据集,该数据集与富有表现力的说话人脸领域相关。我们在 MEAD-TTS 数据集和域外数据集上的实验表明,MM-TTS 能够基于多模态提示取得令人满意的结果。
引用
@article{arxiv.2312.10687,
title = {MM-TTS: Multi-modal Prompt based Style Transfer for Expressive Text-to-Speech Synthesis},
author = {Wenhao Guan and Yishuang Li and Tao Li and Hukai Huang and Feng Wang and Jiayan Lin and Lingyan Huang and Lin Li and Qingyang Hong},
journal= {arXiv preprint arXiv:2312.10687},
year = {2024}
}
备注
Accepted at AAAI2024