面向沉浸式视觉文本语音合成的多源时空知识理解
声音
2024-12-24 v2 人工智能
音频与语音处理
摘要
视觉文本语音合成(VTTS)旨在以环境图像作为提示来合成具有回响感的语音。以往研究侧重于 RGB 模态进行全局环境建模,忽略了深度、说话人位置和环境语义等多源时空知识的潜在价值。为此,本文提出一种新的多源时空知识理解方案,用于沉浸式 VTTS,称为 MS2KU-VTTS。具体而言,我们首先将 RGB 图像作为主要来源,考虑深度图像、来自目标检测的说话人位置知识以及由 Gemini 生成的语义标题作为补充来源。随后,我们提出一种串行交互机制,以有效整合主要来源和补充来源。所得的多源知识根据各来源的贡献程度进行动态集成。这一丰富的多源时空知识交互与集成引导语音生成模型,增强了沉浸式语音体验。实验结果表明,MSKU-VTTS 在生成沉浸式语音方面优于现有基准。演示与代码均可在:https://github.com/AI-S2-Lab/MS2KU-VTTS 提供。
关键词
引用
@article{arxiv.2410.14101,
title = {Multi-Source Spatial Knowledge Understanding for Immersive Visual Text-to-Speech},
author = {Shuwei He and Rui Liu},
journal= {arXiv preprint arXiv:2410.14101},
year = {2024}
}
备注
5 pages, 1 figure, Accepted by ICASSP'2025