让我们想象一段沉默视频中的真实语音
计算机视觉与模式识别
2025-03-20 v1 人工智能
声音
音频与语音处理
摘要
视觉引导的语音生成旨在仅凭面部外观或 lip 动作生成真实语音,而不依赖声学信号,这为电影制作中的配音以及帮助声音障碍患者提供了巨大潜力。尽管近期进展,但现有方法难以在语义、 timbre 和情感抒情方面实现语音与面部动作之间的统一跨模态对齐,从而促使我们提出 Consistent Video-to-Speech(CV2S)作为扩展任务以增强跨模态一致性。为应对挑战,我们引入 ImaginTalk,一个新的跨模态扩散框架,仅使用视觉输入即可生成忠实语音, operates within a discrete space。具体而言,我们提出了离散 lip 对齐器,从 lip 视频预测离散语音标记以捕获语义信息,同时引入错误检测器识别误对齐的标记,并通过掩码语言模型进行后续细化。为进一步提升生成语音的表达性,我们开发了具备面部风格适配器的风格扩散变换器,能够在通道和时间维度上自适应定制身份和抒情动态,同时确保与 lip 相关语义特征的同步。广泛实验表明,ImaginTalk 能否生成高保真语音,在语义细节方面更准确,在 timbre 和情感表达方面更具表现力。我们在项目页面展示了演示:https://imagintalk.github.io。
引用
@article{arxiv.2503.14928,
title = {Shushing! Let's Imagine an Authentic Speech from the Silent Video},
author = {Jiaxin Ye and Hongming Shan},
journal= {arXiv preprint arXiv:2503.14928},
year = {2025}
}
备注
Project Page: https://imagintalk.github.io