DeepAgent: 基于双流多智能体融合的鲁棒多模态深度伪造检测
计算机视觉与模式识别
2025-12-09 v1 人工智能
声音
摘要
合成媒体, 特别是深度伪造 (deepfake), 的不断使用正在成为数字内容验证的突出挑战。尽管近期研究使用了音频和视觉信息, 但大多数将这些线索整合到单个模型中, 这使其对模态不匹配、噪声和操纵仍然脆弱。为解决这一问题, 我们提出 DeepAgent, 一个高级多智能体协作框架, 同时整合视觉和音频两种模态以有效检测深度伪造。DeepAgent 由两个互补智能体构成。Agent-1 使用简化的 AlexNet 基于 CNN 的模型对每个视频进行检查, 以识别深度伪造操纵的符号, 而 Agent-2 通过结合声学特征、Whisper 的音频转录以及通过 EasyOCR 的帧读取图像序列来检测音视频不一致性。它们的决策通过随机森林元分类器进行融合, 通过利用每个智能体所学习的不同决策边界来提高最终性能。这项研究使用三个基准数据集进行评估, 以展示组件级和融合后的性能。Agent-1 在合并后的 Celeb-DF 和 FakeAVCeleb 数据集上实现了 94.35% 的测试准确率。 在 FakeAVCeleb 数据集上, Agent-2 和最终元分类器分别达到 93.69% 和 81.56% 的准确率。此外, 对 DeepFakeTIMIT 的跨数据集验证确认了元分类器的鲁棒性, 其最终准确率达到 97.49%, 并表明其在多样化数据集上具有强大的能力。这些发现表明, 基于层次结构的融合通过缓解单个模态的弱点来增强鲁棒性, 并证明了多智能体方法在应对深度伪造的各种操纵类型方面的有效性。
引用
@article{arxiv.2512.07351,
title = {DeepAgent: A Dual Stream Multi Agent Fusion for Robust Multimodal Deepfake Detection},
author = {Sayeem Been Zaman and Wasimul Karim and Arefin Ittesafun Abian and Reem E. Mohamed and Md Rafiqul Islam and Asif Karim and Sami Azam},
journal= {arXiv preprint arXiv:2512.07351},
year = {2025}
}