VIGIL:面向通用深度伪造检测的部件导向结构推理
计算机视觉与模式识别
2026-03-24 v1
摘要
多模态大型语言模型(MLLM)为通过生成文本解释实现可解释的深度伪造检测提供了可行路径。然而,当前MLLM方法的推理过程将证据生成与操纵局部融合为单一步骤,这种组合模糊了忠实观察与幻觉解释之间的边界,导致结论不可靠。基于此,我们提出VIGIL,一种受专家法医实践启发的部件导向结构性 forensic 框架,采用“规划-检验”管线:模型首先根据全局视觉线索规划哪些面部部件值得检查,然后分别以独立来源的 forensic 证据检查每个部件。分阶段注入机制仅在检验阶段提供部件级 forensic 证据,确保部件选择由模型自身感知驱动,而非受外部信号偏导。我们进一步提出渐进式三阶段训练范式,其中强化学习阶段采用部件感知奖励,以确保解剖有效性与证据-结论一致性。为实现严谨的通用性评估,我们构建OmniFake,一个分层5级基准,模型仅在三个基础生成器上训练,即可逐步测试至野生社交媒体数据。针对OmniFake与跨数据集评估,VIGIL在所有通用性水平上均一致优于专家检测器及并行MLLM方法。
关键词
引用
@article{arxiv.2603.21526,
title = {VIGIL: Part-Grounded Structured Reasoning for Generalizable Deepfake Detection},
author = {Xinghan Li and Junhao Xu and Jingjing Chen},
journal= {arXiv preprint arXiv:2603.21526},
year = {2026}
}
备注
Project Page: https://vigil.best