UMETTS:基于多模态提示的情感文本转语音统一框架
计算与语言
2025-02-20 v2 多媒体
摘要
情感文本转语音 (E-TTS) 合成因其潜在的颠覆性应用而在近年来引起了广泛关注。然而,现有的 E-TTS 方法往往难以捕捉人类情感的细微差别,主要依赖过于简化的情感标签或单一模态输入。本文提出了统一多模态提示诱导情感文本转语音系统 (UMETTS),一种新型框架,利用来自多种模态的情感线索生成高度具表达性和情感共鸣的语音。UMETTS 的核心由两大关键组件构成:情感提示对齐模块 (EP-Align) 和情感嵌入诱导的 TTS 模块 (EMI-TTS)。(1) EP-Align 采用对比学习对齐文本、音频和视觉模态之间的情感特征,确保多模态信息的协调融合。(2) 随后,EMI-TTS 将对齐后的情感嵌入与最新 TTS 模型集成,以准确反映预期情感进行语音合成。广泛的评估表明,UMETTS 在情感准确性和语音自然性方面均实现了显著提升,优于传统 E-TTS 方法在客观与主观指标上的表现。
引用
@article{arxiv.2404.18398,
title = {UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts},
author = {Zhi-Qi Cheng and Xiang Li and Jun-Yan He and Junyao Chen and Xiaomao Fan and Xiaojiang Peng and Alexander G. Hauptmann},
journal= {arXiv preprint arXiv:2404.18398},
year = {2025}
}
备注
Accepted to ICASSP 2025, Code available at https://github.com/KTTRCDL/UMETTS