基于离散流匹配的自动视频配音:跨模态对齐与同步
计算机视觉与模式识别
2026-04-06 v4 人工智能
多媒体
声音
摘要
视频配音需要内容准确、表达生动、声音高质量且精确的唇部同步,但现有方法在这四个方面都难以胜任。为此,我们提出了 DiFlowDubber,第一个基于离散流匹配主干的视频配音框架,采用新颖的两阶段训练策略。在第一个阶段,零样本文本到语音 (TTS) 系统在大规模语料库上进行预训练,其中确定性架构捕获语言结构,Discrete Flow-based Prosody-Acoustic (DFPA) 模块模型化表达性韵律和真实声学特征。在第二个阶段,我们提出了 Content-Consistent Temporal Adaptation (CCTA) 将 TTS 知识迁移到配音领域:其 Synchronizer 实现唇部同步的跨模态对齐。补充地,Face-to-Prosody Mapper (FaPro) 将韵律条件于面部表情,其输出随 Synchronizer 的输出融合,构建捕获韵律-内容相关性的丰富、细粒度多模态嵌入,指导 DFPA 生成用于内容一致语音的表达性韵律和声学标记。在两个基准数据集上的实验表明,DiFlowDubber 在多个评估指标上均优于先前方法。
引用
@article{arxiv.2603.14267,
title = {DiFlowDubber: Discrete Flow Matching for Automated Video Dubbing via Cross-Modal Alignment and Synchronization},
author = {Ngoc-Son Nguyen and Thanh V. T. Tran and Jeongsoo Choi and Hieu-Nghia Huynh-Nguyen and Truong-Son Hy and Van Nguyen},
journal= {arXiv preprint arXiv:2603.14267},
year = {2026}
}
备注
Accepted at CVPR 2026 Findings