中文

VideoGrain:调制时空注意力以实现多粒度视频编辑

计算机视觉与模式识别 2025-02-25 v1

摘要

扩散模型的最新进展显著提升了视频生成与编辑能力。然而,涵盖类级别、实例级别和部件级别修改的多粒度视频编辑仍然是一个艰巨的挑战。多粒度编辑的主要困难包括文本到区域控制的语义错位以及扩散模型内的特征耦合。为了解决这些困难,我们提出了 VideoGrain,这是一种零样本方法,通过调制时空(交叉和自)注意力机制来实现对视频内容的细粒度控制。我们通过放大每个局部提示对其对应的空间解耦区域的注意力,同时最小化与交叉注意力中无关区域的交互,来增强文本到区域的控制。此外,我们通过在自注意力中增加区域内感知并减少区域间干扰来改善特征分离。大量实验表明,我们的方法在真实世界场景中实现了最先进的性能。我们的代码、数据和演示可在 https://knightyxp.github.io/VideoGrain_project_page/ 获取。

关键词

引用

@article{arxiv.2502.17258,
  title  = {VideoGrain: Modulating Space-Time Attention for Multi-grained Video Editing},
  author = {Xiangpeng Yang and Linchao Zhu and Hehe Fan and Yi Yang},
  journal= {arXiv preprint arXiv:2502.17258},
  year   = {2025}
}

备注

ICLR 2025, code and demos are available at https://knightyxp.github.io/VideoGrain_project_page/