中文

面向大规模深度伪造视频检测的可扩展低能耗光学-神经网络混合架构

计算机视觉与模式识别 2026-05-20 v1 机器学习 神经与进化计算 应用物理 光学

摘要

AI 生成视觉媒体的快速传播导致对高效可信深度伪造检测系统的迫切需求。然而,现有基于深度学习的检测方法依赖计算密集且能耗高的推理算法,限制了其可扩展性。本文提出一种混合数字-模拟深度伪造视频检测框架,集成轻量级数字前端与通过可编程光学空间光调制器实现的空间复用光学解码后端,实现大规模并行模拟推理。该系统在单次光学传播过程中同时处理 15 以上视频流,实现了相较于纯数字方法的高吞吐量和准确视频级真实性预测,同时降低计算成本。我们使用不同数据集验证了该混合深度伪造视频处理器,涵盖经典人脸替换、真实世界深度伪造录制及完全 AI 生成视频。采用可见光频段的空间复用实验 setup,在 Celeb-DF 视频数据集上进行单次推理中 15 视频并行测试,实现了平均深度伪造检测准确率、灵敏度和特异度分别为 97.79%、99.86% 和 95.72%。空间复用光学解码器还显示出对各种视频退化、噪声、压缩、实验误对齐及黑盒对抗攻击的鲁棒性。我们的结果表明,将光学计算集成到 AI 推理中可实现吞吐量、能源效率和对抗鲁棒性三项性能的同步提升,而纯数字系统难以实现这一点。

关键词

引用

@article{arxiv.2605.19360,
  title  = {Scalable, Energy-Efficient Optical-Neural Architecture for Multiplexed Deepfake Video Detection},
  author = {Parnian Ghapandar Kashani and Shiqi Chen and Aydogan Ozcan},
  journal= {arXiv preprint arXiv:2605.19360},
  year   = {2026}
}

备注

30 Pages, 8 Figures