中文

BVINet:解锁零标注的盲视频修复

计算机视觉与模式识别 2025-02-04 v1

摘要

视频修复旨在用合理的内容填充视频中的受损区域。现有方法通常假设受损区域的位置已知,主要关注“如何修复”。这种依赖性需要人工使用二值掩码标注受损区域,以指示“何处修复”。然而,这些掩码的标注劳动密集且成本高昂,限制了当前方法的实用性。本文期望通过定义一种新的盲视频修复设定来放宽这一假设,使网络能够直接学习从受损视频到修复结果的映射,从而消除对受损区域标注的需求。具体而言,我们提出了一种端到端的盲视频修复网络(BVINet),以同时解决“何处修复”和“如何修复”的问题。一方面,BVINet 通过检测帧的语义不连续区域并利用视频的时间一致性先验,能够预测受损区域的掩码。另一方面,预测的掩码被整合到 BVINet 中,使其能够从未受损区域捕获有效的上下文信息以填充受损区域。此外,我们引入了一致性损失来正则化 BVINet 的训练参数。通过这种方式,掩码预测和视频补全相互约束,从而最大化训练模型的整体性能。此外,我们定制了一个包含合成受损视频、真实世界受损视频及其对应完整视频的数据集。该数据集为推进盲视频修复研究提供了宝贵资源。大量的实验结果证明了我们方法的有效性和优越性。

关键词

引用

@article{arxiv.2502.01181,
  title  = {BVINet: Unlocking Blind Video Inpainting with Zero Annotations},
  author = {Zhiliang Wu and Kerui Chen and Kun Li and Hehe Fan and Yi Yang},
  journal= {arXiv preprint arXiv:2502.01181},
  year   = {2025}
}