Deepfake侦探:通过稀疏特征和流形解释神经网络侦检
计算机视觉与模式识别
2025-12-29 v1 机器学习
摘要
深度伪造检测模型在识别合成媒体方面已取得高准确率,但其决策过程仍基本不透明。本文我们提出了一个用于深度伪造检测的机制解释框架,适用于视觉-语言模型。我们的 метод结合稀疏自编码器 (SAE) 分析内部网络表示,以及一种新颖的 forensic 流形分析,用于探讨模型特征如何响应受控的 forensic 工艺操纵。我们演示了只有少数潜在特征在每一层中被主动使用,模型特征流形的几何属性,包括内在维度、曲率和特征选择性,随不同类型的深度伪造工艺而系统性变化。这些见解为打开深度伪造检测器的“黑盒”提供了第一步,使我们能够识别哪些学习的特征对应于特定的 forensic 工艺,并指导开发更具可解释性和鲁棒性的模型。
引用
@article{arxiv.2512.21670,
title = {The Deepfake Detective: Interpreting Neural Forensics Through Sparse Features and Manifolds},
author = {Subramanyam Sahoo and Jared Junkin},
journal= {arXiv preprint arXiv:2512.21670},
year = {2025}
}
备注
10 pages, 5 figures, Initial Work