面向生成的本土音视频对齐
计算机视觉与模式识别
2026-05-29 v1
摘要
联合音视频生成旨在合成同步且语义连贯的视听内容。然而,现有开源方法主要依赖双塔设计(采用后验对齐)或完全统一的三模态设计(将文本上下文、音频和视频混合在一个共享空间中)。前者削弱了细粒度的音视频协同演化,而后者则将语义条件与低层同步耦合在一起。为此,我们提出了NAVA(Native Audio-Visual Alignment),一种用于联合音视频生成的本土音视频对齐框架。NAVA基于上下文条件的本土音视频对齐:它首先在专门的交互空间中建立音视频对应关系,然后使用外部上下文来条件化联合去噪过程。具体而言,NAVA采用Align-then-Fuse MMDiT架构,从模态感知的音视频对齐过渡到模态共享的联合去噪。此外,我们引入Timbre-in-Context Conditioning,将参考音色线索与相应的语音片段关联,以实现可控的语音音色。实验在Verse-Bench和Seed-TTS上进行,并通过用户研究,表明NAVA仅需6.3B参数即可实现优异的视频质量、精准的音视频同步、具竞争力的音频质量以及更强的参考音色可控性。
引用
@article{arxiv.2605.30073,
title = {Native Audio-Visual Alignment for Generation},
author = {Longbin Ji and Guan Wang and Xuan Wei and Chenye Yang and Xiangrui Liu and Zhenyu Zhang and Shuohuan Wang and Yu Sun and Jingzhou He},
journal= {arXiv preprint arXiv:2605.30073},
year = {2026}
}
备注
Project page: https://ernie-research.github.io/NAVA/