中文

视觉基础模型在人脸深度伪造检测中的跨域泛化极限

计算机视觉与模式识别 2026-05-26 v1 人工智能 机器学习

摘要

生成模型的快速演化使得能够创建超逼真的人脸深度伪造,暴露了现代数字法forensics 的关键漏洞:检测器无法对未见的操纵技术进行泛化。传统网络 suffer 从 representation collapse,过拟合到特定训练生成器的局部化 artifact 指纹。本文调查现代视觉基础模型是否可作为可泛化、即插即用的特征提取器,能够在完全未见的生成流形上追踪 Forensic 异常。我们对比了三个基础学习范式进行系统的跨域评估:全监督的宏语义特征 (RoPE-ViT)、纯自监督的几何特征 (DINOv3) 以及多教师 agglomerative 表示 (NVIDIA C-RADIOv4-H)。通过对冻结 backbone 施加下游线性探测,我们映射了这些架构在具有挑战性的 DF40 数据集上的性能局限。我们的实证发现揭示了 pre-training 范式与参数规模之间的内在权衡,证明尽管 foundation 模型在整个人脸合成方面保持高辨识能力,但局部人脸编辑技术暴露了线性探测评估结构的根本边界。

关键词

引用

@article{arxiv.2605.24965,
  title  = {Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection},
  author = {Ibrahim Delibasoglu},
  journal= {arXiv preprint arXiv:2605.24965},
  year   = {2026}
}