LAVA:面向鲁棒深度伪造检测与定位的分层音视频防篡改水印
计算机视觉与模式识别
2026-04-28 v1
摘要
主动式水印技术为深度伪造篡改检测与定位提供了有前景的方案。然而,现有方法常常将音频与视觉证据分离处理,并假设水印信号在实际降解情况下保持可靠,这使得篡改定位易受到多模态错位和压缩失真的影响。此外,现有的半fragile视觉水印方法因其嵌入的频段与压缩敏感区域重合,往往在编解码压缩下性能显著下降。为此,我们提出分层音视频防篡改水印(LAVA),一种面向深度伪造篡改检测与定位的校准感知音视频水印融合框架。LAVA利用跨模态水印融合与校准感知对齐,在压缩和音视频不同步情况下,保持篡改证据的一致性与可靠性,从而实现鲁棒的篡改定位。大量实验表明,LAVA实现了近乎完美的检测性能(AP=0.999),对压缩和多模态错位具有良好的鲁棒性,并显著优于现有音视频融合基线方法,提高了篡改定位的可靠性。
引用
@article{arxiv.2604.23957,
title = {LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization},
author = {Bokang Zeng and Zheng Gao and Xiaoyu Li and Xiaoyan Feng and Jiaojiao Jiang},
journal= {arXiv preprint arXiv:2604.23957},
year = {2026}
}
备注
10 pages, submitted to ACMMM 2026