基于层次化编解码扩散的视频到语音生成
声音
2026-04-20 v1 计算机视觉与模式识别
摘要
视频到语音(VTS)生成旨在从无声视频合成语音。然而,现有 VTS 方法忽略了语音的层次化本质,这种本质跨越粗糙说话人感知到细粒度的韵律细节。这种忽视阻碍了在特定层次上进行视觉与语音特征的直接对齐。在本文中,利用基于残差向量量化(RVQ)编解码的层次化结构,我们提出了一种新的层次化编解码扩散 Transformer(HiCoDiT),通过离散语音标记的内在层次结构实现强大的音视频对齐。具体而言,由于低级标记编码粗糙的说话人感知语义,高级标记捕获细粒度的韵律动态,HiCoDiT 采用低级和高级模块在不同层次生成标记。低级模块以与唇部同步的动作和面部身份信息为条件,以捕获说话人感知的内容;高级模块则利用面部表情来调制韵律动态。最后,为实现更有效的粗到细条件,本文提出了一种双尺度自适应实例层归一化,该方法通过通道归一化捕获全局演讲风格,通过时间归一化捕获局部韵律动态。广泛的实验表明,HiCoDiT 在保真度和表达性方面优于基线方法,凸显了离散建模在 VTS 中的潜力。代码和语音演示均可在 https://github.com/Jiaxin-Ye/HiCoDiT 提供。
引用
@article{arxiv.2604.15923,
title = {Hierarchical Codec Diffusion for Video-to-Speech Generation},
author = {Jiaxin Ye and Gaoxiang Cong and Chenhui Wang and Xin-Cheng Wen and Zhaoyang Li and Boyuan Cao and Hongming Shan},
journal= {arXiv preprint arXiv:2604.15923},
year = {2026}
}
备注
CVPR 2026