面向沉浸式视觉文本转语音的多模态多尺度空间环境理解
计算机视觉与模式识别
2025-01-16 v3 人工智能
多媒体
摘要
视觉文本转语音(VTTS)旨在以环境图像为提示,为口语内容合成混响语音。该任务的挑战在于从图像中理解空间环境。已有许多尝试从空间图像的RGB空间中提取全局空间视觉信息。然而,局部和深度图像信息对于理解空间环境至关重要,而先前的工作忽略了这一点。为解决这些问题,我们提出了一种新颖的多模态多尺度空间环境理解方案,以实现沉浸式VTTS,称为M2SE-VTTS。多模态旨在同时利用空间图像的RGB和深度空间来学习更全面的空间信息,多尺度则旨在同时对局部和全局空间知识进行建模。具体来说,我们首先将RGB和深度图像分割成块,并采用Gemini生成的环境描述来引导局部空间理解。之后,通过局部感知的全局空间理解来整合多模态和多尺度特征。通过这种方式,M2SE-VTTS有效地建模了多模态空间环境中局部与全局空间上下文之间的交互。客观和主观评估表明,我们的模型在环境语音生成方面优于先进的基线方法。代码和音频样本可在https://github.com/AI-S2-Lab/M2SE-VTTS获取。
引用
@article{arxiv.2412.11409,
title = {Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech},
author = {Rui Liu and Shuwei He and Yifan Hu and Haizhou Li},
journal= {arXiv preprint arXiv:2412.11409},
year = {2025}
}
备注
9 pages,2 figures, Accepted by AAAI'2025