深度伪造的人脸动态可解释性:作为行为与感知痕迹
计算机视觉与模式识别
2026-04-24 v1 人机交互
机器学习
摘要
深度伪造检测研究主要聚焦于深度学习方法,尽管在基准测试上表现良好,但对区分真实与人造面部行为的关键特征提供了有限的解释。本研究提出一种基于面部动态生物行为特征的可解释方法,并评估计算检测策略与人类感知判断之间的关系。我们识别出面部运动的核心低维模式,据此推导出描述时空结构的时序特征。使用这些特征训练的传统机器学习分类器实现了显著但有限的深度伪造分类性能,这由人造面部动态中更显著的高阶时序不规则性驱动。值得注意的是,对于包含情感表情的视频检测准确率显著高于不含情感表情的视频。情感价值分类分析进一步表明,情感信号在深度伪造中系统性被降低,从而解释了情感动态对检测的差异化影响。此外,我们通过评估模型决策与人类感知检测之间的关系,提供了一个常被忽视的可解释性维度。模型与人类判断在情感视频中一致,而在非情感视频中则分歧。即便在输出一致的地方,底层检测策略也不同。这些发现表明,换脸后的深度伪造携带可测量的行为指纹,尤其在情感表达时最为显著。此外,模型-人类比较表明,可解释的计算特征与人类感知可能提供的是互补而非冗余的检测路径。
引用
@article{arxiv.2604.21760,
title = {Interpretable facial dynamics as behavioral and perceptual traces of deepfakes},
author = {Timothy Joseph Murphy and Jennifer Cook and Hélio Clemente José Cuve},
journal= {arXiv preprint arXiv:2604.21760},
year = {2026}
}
备注
Main paper: 19 pages, 5 figures, 4 tables. SI Appendix: 11 pages, 3 figures, 6 tables