中文

基于 ICAC:面向视频扩散 Transformer 的语音驱动视频生成中的音频控制

计算机视觉与模式识别 2025-12-23 v1

摘要

近期视频生成技术的进展催生了向统一、基于 Transformer 的基础模型转变,这类模型能够在上下文中处理多种条件输入,但主要聚焦于文本、图像和深度图等模态,而严格时序信号如音频的探索仍较不足。本文引入 ICAC(In-Context Audio Control of video diffusion transformers,语音驱动视频生成中的音频控制)框架,探究将音频信号集成到统一的全注意力架构(类似 FullDiT)中,用于语音驱动视频生成。我们系统性地研究了三种不同的音频注入机制:标准交叉注意力、2D 自注意力和统一 3D 自注意力。我们的发现表明,3D 注意力在捕获时空音视频关联方面具有最高潜力,但同时也带来了显著的训练挑战。为此,我们提出了掩码 3D 注意力(Masked 3D Attention)机制,通过约束注意力模式以实现时序对齐,从而实现稳定训练和卓越性能。我们的实验表明,该方法在音频流和参考图像条件下,实现了强大的唇部同步与视频质量。

关键词

引用

@article{arxiv.2512.18772,
  title  = {In-Context Audio Control of Video Diffusion Transformers},
  author = {Wenze Liu and Weicai Ye and Minghong Cai and Quande Liu and Xintao Wang and Xiangyu Yue},
  journal= {arXiv preprint arXiv:2512.18772},
  year   = {2025}
}