中文

基于深度注意力噪声学习的可信视频填色定位

计算机视觉与模式识别 2024-06-21 v1 密码学与安全

摘要

数字视频填色技术近年来已显著提升,但填色原本用于修复受损区域,亦可被滥用以删除关键物体从而制造虚假场景与事实。因此,准确识别填色区域显尤重要。本文提出一种具备卓越鲁棒性与泛化能力的可信视频填色定位网络 (TruVIL)。我们观察到高频噪声可有效揭示填色区域,因而设计多阶段深度注意力噪声学习以捕获填色痕迹。首先,基于 3D 高通 (HP3D) 层构建多尺度噪声提取模块,从输入 RGB 帧生成噪声模态;随后通过跨模态注意力融合模块探索此两种互补模态之间的相关性以促进相互特征学习;最后,借助注意力噪声解码模块对空间细节进行选择性增强,以提升网络的定位性能。为准备足够的训练样本,我们还构建了一个包含 2500 个视频的帧级视频对象分割数据集,所有帧均标注像素级位置。大量实验结果验证了 TruVIL 在与最新方法之间的优势。尤其是在各种填色视频上的定量与定性评估,均证明了我们提出的 TruVIL 在鲁棒性与泛化能力方面的显著优势。代码与数据集将在 https://github.com/multimediaFor/TruVIL 上发布。

关键词

引用

@article{arxiv.2406.13576,
  title  = {Trusted Video Inpainting Localization via Deep Attentive Noise Learning},
  author = {Zijie Lou and Gang Cao and Man Lin},
  journal= {arXiv preprint arXiv:2406.13576},
  year   = {2024}
}