基于合成数据的 V-LASIK:视频中的一致性玻璃移除
计算机视觉与模式识别
2025-04-15 v2 人工智能
图形学
摘要
扩散生成模型最近在图像和视频编辑方面展现出惊人的能力。然而,局部视频编辑——特别是移除小属性如玻璃——仍是一个挑战。现有方法要么过度改变视频,要么生成不真实的痕迹,要么无法在整个视频中一致执行请求的编辑。本文聚焦于在视频中实现一致且保持身份的玻璃移除,将其作为一致局部分属性移除的案例研究。由于缺乏配对数据,我们采用弱监督方法,通过调整预训练扩散模型生成合成的不完美数据。我们展示,尽管数据不完美,通过学习我们生成的数据并利用预训练扩散模型的先验,我们的模型能够在保持原始视频内容的同时,一致地执行所需的编辑。此外,我们通过成功应用于面部贴纸移除,举例说明了该方法对其他局部视频编辑任务的泛化能力。我们的做法在现有方法上显著提升,展示了利用合成数据和强视频先验进行局部视频编辑任务的潜力。
引用
@article{arxiv.2406.14510,
title = {V-LASIK: Consistent Glasses-Removal from Videos Using Synthetic Data},
author = {Rotem Shalev-Arkushin and Aharon Azulay and Tavi Halperin and Eitan Richardson and Amit H. Bermano and Ohad Fried},
journal= {arXiv preprint arXiv:2406.14510},
year = {2025}
}