提升基于参考生成的引导式视频填充
计算机视觉与模式识别
2024-12-13 v1
摘要
视频填充(VI)是一项具有挑战性的任务,需要有效地在帧与帧之间传播可观察内容,同时生成原始视频中不存在的新内容。本研究提出一种稳健且实用的 VI 框架,利用大型生成模型进行参考生成,结合先进的像素传播算法。凭借强大的生成模型,本方法不仅显著提升了对象去除的帧级质量,还能根据用户提供的文本提示合成缺失区域的新内容。对于像素传播,我们引入一种单次像素拉取方法,有效避免了重复抽样导致的误差累积,同时保持亚像素精度。为评估 VI 方法在真实场景中的表现,我们还构建了一个高质量 VI 数据集(HQVI),包含使用 alpha 遮罩合成的精心生成视频。实验在公开基准数据集和 HQVI 数据集上表明,我们的方法在视觉质量和评估指标上显著高于现有解决方案。此外,本方法能够轻松处理超过 2K 分辨率的高分辨率视频,凸显了其在实际应用中的优势。
引用
@article{arxiv.2412.08975,
title = {Elevating Flow-Guided Video Inpainting with Reference Generation},
author = {Suhwan Cho and Seoung Wug Oh and Sangyoun Lee and Joon-Young Lee},
journal= {arXiv preprint arXiv:2412.08975},
year = {2024}
}
备注
AAAI 2025