VividVoice:面向场景感知的视觉驱动语音合成统一框架
声音
2026-02-04 v1 人工智能
摘要
我们提出并定义了一种新任务——场景感知视觉驱动语音合成(Scene-Aware Visually-Driven Speech Synthesis),旨在解决现有语音生成模型在创建与真实物理世界一致的沉浸式听觉体验方面的局限性。为解决数据稀缺和模态脱节的两个核心挑战,我们提出 VividVoice,一个统一的生成框架。首先,我们构建了一个大规模高质量的混合多模态数据集 Vivid-210K,通过一种创新的程序化管道,首次在视觉场景、说话人身份与音频之间建立了强关联。其次,我们设计了核心对齐模块 D-MSVA,利用解耦内存库架构和跨模态混合监督策略,实现从视觉场景到声韵和环境声学特征的细粒度对齐。主观和客观实验结果均提供了强有力的证据,表明 VividVoice 在音频保真度、内容清晰度和多模态一致性方面显著优于现有基线模型。我们的演示已发布于 https://chengyuann.github.io/VividVoice/。
关键词
引用
@article{arxiv.2602.02591,
title = {VividVoice: A Unified Framework for Scene-Aware Visually-Driven Speech Synthesis},
author = {Chengyuan Ma and Jiawei Jin and Ruijie Xiong and Chunxiang Jin and Canxiang Yan and Wenming Yang},
journal= {arXiv preprint arXiv:2602.02591},
year = {2026}
}
备注
Accepted by ICASSP 2026