图像流形路径:基于视频生成的图像编辑
计算机视觉与模式识别
2025-03-21 v4 人工智能
机器学习
摘要
图像编辑的最新进展由图像扩散模型推动,取得了显著进展。然而,这些模型仍面临诸多挑战,因它们常常难以准确遵循复杂的编辑指令,并且经常以牺牲原始图像关键要素的代价来换取保真度。与此同时,视频生成技术也取得了显著进展,具有有效作为一致且连续世界模拟器的模型。在本文中,我们提出将这两个领域融合,利用图像到视频模型进行图像编辑。我们将图像编辑重新表述为一个时间过程,使用预训练的视频模型从原始图像平滑过渡到所需的编辑。该方法持续遍历图像流形,确保一致的编辑同时保留原始图像的关键要素。我们的方法在基于文本的图像编辑中实现了最先进的结果,显著提高了编辑准确性和图像保真度。欢迎访问我们的项目页面 https://rotsteinnoam.github.io/Frame2Frame。
引用
@article{arxiv.2411.16819,
title = {Pathways on the Image Manifold: Image Editing via Video Generation},
author = {Noam Rotstein and Gal Yona and Daniel Silver and Roy Velich and David Bensaïd and Ron Kimmel},
journal= {arXiv preprint arXiv:2411.16819},
year = {2025}
}