Baton:用于联合视频-音频生成的显式语义蓝图
计算机视觉与模式识别
2026-05-26 v1
摘要
当前开源扩散模型在生成稳定且同步的音视频内容方面存在挑战,尤其是在需要复杂语义推理的场景。根本原因在于,现有方法依赖于来自通用编码器的粗糙文本嵌入来指导音视频去噪,这丢弃了细粒度语义且缺乏共享的长期计划,导致去噪轨迹之间协调不力和跨模态对齐脆弱。我们提出Baton,是第一个引入显式语义规划到联合视频-音频生成中的框架。我们的关键洞察在于,用语义丰富、模态感知的计划令牌补充粗糙文本指导,这些令牌在去噪之前进行联合推理和相互对齐,能够同时恢复细粒度语义细节并建立共享蓝图,以协调两种模态的去噪轨迹。具体而言,Baton首先引入VA-Planner,一种具备双语义对齐塔的多模态语言模型,其中可学习查询跨注意视频和音频特征,以产生一对语义对齐的视频和音频计划令牌作为关键帧级蓝图。这些计划令牌通过跨注意层注入扩散主干,提供与粗糙文本嵌入互补的时序化指导。由于计划令牌不与扩散潜在变量存在一一对应关系,我们进一步提出相对语义RoPE,一种相对位置编码,将计划令牌和潜在变量映射到共享的时空坐标系中,使每个潜在变量都能准确关注其位置对应的语义线索。在基准测试上的实验表明,Baton在定性和定量分析上均表现出色。
引用
@article{arxiv.2605.25195,
title = {Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation},
author = {Shuyuan Tu and Qi Tian and Zihan Yang and Yue Wu and Xintong Han and Weijie Kong and Jiangfeng Xiong and Jian-Wei Zhang and Zhao Zhong and Liefeng Bo and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2605.25195},
year = {2026}
}