中文

零射时视频翻译与编辑:基于帧空间-时间对应关系

计算机视觉与模式识别 2025-12-04 v1

摘要

文本到图像扩散模型取得的显著成功,推动了大量研究旨在将其应用于视频任务。零射时技术旨在无需进一步训练即可将图像扩散模型适用于视频。近期方法主要强调将帧间对应关系整合至注意力机制中。然而,对有效特征进行注意力指导的软约束可能导致时序不一致。本文提出FRESCO方法,将帧内对应与帧间对应结合,形成更为稳健的空间-时间约束。此举确保了在帧之间对语义相似内容的一致性变换。我们的做法超越注意力指导,显式优化特征,实现高度空间-时间一致性,显著提升人工操纵视频的视觉连贯性。我们在视频到视频翻译和文本引导视频编辑两个零射时任务上验证了FRESCO的适用性。广泛实验表明,该框架在生成高质量、连贯视频方面有效,显著超越当前零射时方法。

关键词

引用

@article{arxiv.2512.03905,
  title  = {Zero-Shot Video Translation and Editing with Frame Spatial-Temporal Correspondence},
  author = {Shuai Yang and Junxin Lin and Yifan Zhou and Ziwei Liu and Chen Change Loy},
  journal= {arXiv preprint arXiv:2512.03905},
  year   = {2025}
}

备注

Code: https://github.com/Sunnycookies/FRESCO-v2, Project: https://williamyang1991.github.io/projects/FRESCOv2/