中文

重新注意力可控视频扩散编辑

计算机视觉与模式识别 2024-12-17 v1 人工智能

摘要

文本引导的视频编辑因其简化流程而受欢迎,用户只需编辑与源视频对应的文本提示。最近研究探索并利用大规模文本到图像扩散模型进行文本引导视频编辑,取得了显著效果。但仍存在物体定位错误、物体数量不正确等问题。因此,视频编辑的可控性仍是一个巨大挑战。本文提出重新注意力可控视频扩散编辑(ReAtCo)方法。具体地,为了以无需训练的方式将目标物体的空间位置与编辑后的文本提示对齐,我们提出重新注意力扩散(RAD)在去噪阶段重新聚焦编辑文本提示与目标视频之间的交叉注意力激活响应,从而生成空间位置对齐且语义高保真的操作视频。特别地,为了忠实保留不变区域内容并减少边界伪影,我们提出不变区域引导联合采样(IRJS)策略,以减轻每个去噪时间步中关于不变区域的固有采样误差,并约束生成内容与不变区域内容协调。实验验证ReAtCo持续提高了视频扩散编辑的可控性,实现了优越的视频编辑性能。

关键词

引用

@article{arxiv.2412.11710,
  title  = {Re-Attentional Controllable Video Diffusion Editing},
  author = {Yuanzhi Wang and Yong Li and Mengyi Liu and Xiaoya Zhang and Xin Liu and Zhen Cui and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2412.11710},
  year   = {2024}
}

备注

Accepted by AAAI 2025. Codes are released at: https://github.com/mdswyz/ReAtCo