用于视频拼接定位的时空协同注意力融合网络
计算机视觉与模式识别
2023-09-19 v1 密码学与安全
摘要
数字视频拼接已变得轻而易举且无处不在。恶意用户复制某视频的若干区域并粘贴至另一视频以制造逼真的伪造内容。盲检测此类视频中的伪造区域具有重要意义。本文提出一种时空协同注意力融合网络(SCFNet)用于视频拼接定位。具体而言,采用三流网络作为编码器以捕获跨多帧的篡改痕迹。通过新颖的并行与交叉协同注意力融合模块,实现时空取证特征的深度交互与融合。采用轻量级多层感知机(MLP)解码器生成像素级篡改定位图。我们创建了一个新的大规模视频拼接数据集用于训练 SCFNet。在基准数据集上的大量测试表明,我们的 SCFNet 在定位与泛化性能上优于当前最优方法。代码与数据集将发布于 https://github.com/multimediaFor/SCFNet。
引用
@article{arxiv.2309.09482,
title = {Spatio-temporal Co-attention Fusion Network for Video Splicing Localization},
author = {Man Lin and Gang Cao and Zijie Lou},
journal= {arXiv preprint arXiv:2309.09482},
year = {2023}
}