中文

ACD:通过注意力监睘实现视频扩散模型的直接条件控制

计算机视觉与模式识别 2025-12-25 v1

摘要

可控性是视频合成的基本要求,准确对齐条件信号至关重要。现有的无分类器指南方法通常通过建模数据与条件的联合分布来间接实现条件控制,往往导致对指定条件的可控性有限。基于分类器的指南通过外部分类器强制执行条件,但模型可能利用此机制而非真正满足预期条件来提升分类器得分,导致对抗性瑕疵并限制实际可控性。本文提出注意力-条件扩散 (ACD) 框架,通过注意力监睘实现视频扩散模型的直接条件控制。为支持此目标,我们引入稀疏三维感知物体布局作为高效条件信号,配合专用的 Layout ControlNet 以及自动化标注管线,以实现可扩展的布局集成。大量实验表明,ACD 在基准视频生成数据集上实现了对条件输入的优异对齐,同时保持了时间一致性和视觉保真度,为条件视频合成建立了有效范式。

关键词

引用

@article{arxiv.2512.21268,
  title  = {ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision},
  author = {Weiqi Li and Zehao Zhang and Liang Lin and Guangrun Wang},
  journal= {arXiv preprint arXiv:2512.21268},
  year   = {2025}
}