中文

EVA:零样本精确属性与多对象视频编辑

计算机视觉与模式识别 2024-03-26 v1

摘要

当前基于扩散模型的视频编辑主要侧重于局部编辑(例如,对象/背景编辑)或利用各种密集对应关系进行全局风格编辑。然而,这些方法往往无法在保留原始布局的同时准确编辑前景和背景。我们发现问题的症结在于指定区域间注意力权重分布不精确,包括不准确的文本到属性控制和注意力泄漏。为了解决这个问题,我们引入了 EVA,这是一个针对具有复杂运动的以人为中心的视频量身定制的零样本和多属性视频编辑框架。我们结合了时空布局引导注意力机制,该机制利用了跨帧扩散特征固有的正负对应关系。为了避免注意力泄漏,我们利用这些对应关系来提升所有视频帧中同一属性内 token 的注意力得分,同时限制自注意力层中不同属性 token 之间的交互。为了实现精确的文本到属性操作,我们在交叉注意力层中使用聚焦于特定布局区域的离散文本嵌入。得益于精确的注意力权重分布,EVA 可以轻松泛化到多对象编辑场景,并实现准确的身份映射。大量实验表明,EVA 在真实场景中取得了 SOTA 结果。完整结果见 https://knightyxp.github.io/EVA/

关键词

引用

@article{arxiv.2403.16111,
  title  = {EVA: Zero-shot Accurate Attributes and Multi-Object Video Editing},
  author = {Xiangpeng Yang and Linchao Zhu and Hehe Fan and Yi Yang},
  journal= {arXiv preprint arXiv:2403.16111},
  year   = {2024}
}

备注

Project page: https://knightyxp.github.io/EVA