中文

FRESCO: 面向零样本视频翻译的时空对应关系

计算机视觉与模式识别 2024-03-20 v1

摘要

文本到图像扩散模型的卓越成效激发了对其在视频领域潜在应用的广泛探索。零样本方法旨在无需模型训练的情况下将图像扩散模型扩展至视频。现有方法主要侧重于将帧间对应关系融入注意力机制。然而,对决定在何处关注有效特征所施加的软约束有时并不充分,会导致时间不一致性。在本文中,我们引入了 FRESCO,将帧内对应关系与帧间对应关系相结合,以建立更鲁棒的时空约束。这一增强确保了跨帧语义相似内容的更一致变换。除了单纯的注意力引导外,我们的方法还涉及特征的显式更新,以实现与输入视频的高度时空一致性,从而显著提升所生成翻译视频的视觉连贯性。大量实验证明了我们提出的框架在生成高质量、连贯视频方面的有效性,标志着对现有零样本方法的显著改进。

关键词

引用

@article{arxiv.2403.12962,
  title  = {FRESCO: Spatial-Temporal Correspondence for Zero-Shot Video Translation},
  author = {Shuai Yang and Yifan Zhou and Ziwei Liu and Chen Change Loy},
  journal= {arXiv preprint arXiv:2403.12962},
  year   = {2024}
}

备注

CVPR 24, Code: https://github.com/williamyang1991/FRESCO, Project: https://www.mmlab-ntu.com/project/fresco/