基于对比学习的视频 inpainting 局部化
计算机视觉与模式识别
2024-06-26 v1 密码学与安全
摘要
深度视频 inpainting 通常被用作恶意手段,通过移除重要物体来创建假视频。识别被 inpaint 区域是一项重要任务。本文提出一种简单而有效的 Forensic 方法,用于 Video Inpainting Localization with ContrAstive Learning(ViLocal)。具体而言,应用 3D Uniformer 编码器对视频噪声残差进行编码,以学习有效的时空 Forensic 特征。为增强判别能力,采用监督对比学习,通过吸引/排斥原始像素对和伪造像素对,捕捉 inpainted 视频的局部不一致性。通过轻量级卷积解码器,得到像素级的 inpainting 局部化图。为准备足够的训练样本,我们构建了一个包含 2500 个视频、每帧带有像素级标注的数据集。大量实验结果验证了 ViLocal 在状态-of-the-art 方法上的优势。代码和数据集将在 https://github.com/multimediaFor/ViLocal 上提供。
关键词
引用
@article{arxiv.2406.17628,
title = {Video Inpainting Localization with Contrastive Learning},
author = {Zijie Lou and Gang Cao and Man Lin},
journal= {arXiv preprint arXiv:2406.17628},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2406.13576