轻量化互补线索融合:稳健视频人脸伪造检测
计算机视觉与模式识别
2026-05-29 v1 机器学习
多媒体
摘要
当前的人脸视频伪造检测器使用宽或双流主干网络。我们展示,单一轻量化融合两种手工线索即可实现更高精度且模型更小。基于Xception基线模型(2190万参数),我们构建两个检测器:LFWS通过为低频Wavelet-Denoised Feature(WDF)与从Spatial-Phase Shallow Learning(SPSL)派生的相位谱通道添加1x1卷积来组合;LFWL以相同方式将WDF与Local Binary Patterns(LBP)融合。该额外模块仅增加292个参数,总参数保持在2190万,小于F3Net(2250万)和SRM(5530万)的一半。即使有最小的额外开销,融合模型在FaceForensics++上的平均ROC-AUC从74.8%提升至78.6%,在DFDC-Preview上从70.5%提升至74.9%,相较于Xception基线提升了3.8%和4.4%。它们在八个公开基准上 consistently 优于F3Net、SRM和SPSL,无需额外数据或测试时增强。这些结果表明, carefully 组合的手工特征通过轻量化融合模块可在显著低于可比较频率基线检测器的成本下提供竞争的鲁棒性。我们的发现表明,需要重新评估以规模为导向的设计选择在人脸视频伪造检测中的作用。
引用
@article{arxiv.2605.29092,
title = {Lightweight Complementary-Cue Fusion for Robust Video Face Forgery Detection},
author = {Sunghwan Baek and Tariq Anwaar and Karanveer Singh and Rita Singh},
journal= {arXiv preprint arXiv:2605.29092},
year = {2026}
}
备注
13 pages, 6 figures, 3 tables