CapsFake:用于检测指令引导式深度伪造图像的多模态胶囊网络
计算机视觉与模式识别
2025-04-29 v1 人工智能
摘要
深度伪造技术的快速演进,尤其是在指令引导式图像编辑中,威胁了数字图像的完整性,通过启用对细微且情境感知的操纵实现。从实图像和文本提示条件生成的编辑往往对人类和现有检测系统难以察觉,揭示了当前防御的显著局限性。我们提出一种新型多模态胶囊网络 CapsFake,旨在通过整合视觉、文本和频域模态的低级胶囊来检测此类深度伪造图像编辑。高级胶囊通过竞争路由机制预测,动态聚合局部特征,以精确识别被操纵区域。评估包括 MagicBrush、Unsplash Edits、Open Images Edits 和 Multi-turn Edits 等多样化数据集,CapsFake 在检测准确率上领先最新方法高达 20%。消融研究表明,其在自然扰动下的检测率可达 94%,对抗攻击下达 96%,并在未见编辑情境中表现出色。该方法为对抗复杂图像操纵建立了强大的框架。
引用
@article{arxiv.2504.19212,
title = {CapsFake: A Multimodal Capsule Network for Detecting Instruction-Guided Deepfakes},
author = {Tuan Nguyen and Naseem Khan and Issa Khalil},
journal= {arXiv preprint arXiv:2504.19212},
year = {2025}
}
备注
20 pages