通过跨模态上下文学习提升联合音视频生成
计算机视觉与模式识别
2026-03-20 v1
摘要
基于双流变压器架构的联合音视频生成方法已成为当前研究的主导范式。通过融合预训练视频扩散模型和音频扩散模型,以及跨模态交互注意力模块,可实现高质量、时序同步的音视频内容生成,所需训练数据有限。本文首先重审双流变压器范式,进一步分析其局限性,包括由控制跨模态交互的门控机制导致的模型流形变异、跨模态注意力引入的多模态背景区域偏差、训练与推理过程中多模态无条件引导(CFG)的不一致性,以及来自多个条件之间的冲突。为缓解这些问题,我们提出了跨模态上下文学习(CCL),并配合若干精心设计的模块。时序对齐的 RoPE 与分区(TARP)有效增强了音频潜在表示与视频潜在表示之间的时序对齐。跨模态上下文注意力(CCA)模块中的可学习上下文令牌(LCT)和动态上下文路由(DCR)为跨模态信息提供稳定的无条件锚点,同时根据不同训练任务动态路由,进一步提升模型的收敛速度和生成质量。在推理阶段,无条件上下文引导(UCG)利用 LCT 提供的无条件支持,促进不同形式的 CFG,提高训练-推理一致性,进一步缓解冲突。通过全面评估,CCL 在与最新学术方法的比较中实现了领先性能,同时所需资源显著减少。
引用
@article{arxiv.2603.18600,
title = {Improving Joint Audio-Video Generation with Cross-Modal Context Learning},
author = {Bingqi Ma and Linlong Lang and Ming Zhang and Dailan He and Xingtong Ge and Yi Zhang and Guanglu Song and Yu Liu},
journal= {arXiv preprint arXiv:2603.18600},
year = {2026}
}