TruthLens:通用深度伪造推理的视觉 grounding 框架
计算机视觉与模式识别
2025-09-04 v3 人工智能
摘要
检测深度伪造 (DeepFake) 已成为重要研究领域,因为 AI 图像生成器的广泛应用使得人脸操控和全合成内容的制造变得毫无难度,而现有方法往往仅限于二元分类 (真实 vs 伪造),且缺乏可解释性。为此,我们提出了 TruthLens,一种新型、统一且高度可泛化的框架,超越传统二元分类,为预测提供详细的文本推理。与常规方法不同,TruthLens 执行多模态大语言模型 (MLLM) 的视觉 grounding。TruthLens 采用任务驱动的表示集成策略,将来自 MLLM 的全局语义上下文与通过显式跨模态适配的视觉模型的区域特定 Forensic 线索相结合。这使其能够为人脸操控和全合成内容提供细粒度、区域 grounding 推理,并支持如 "眼睛/鼻子/嘴唇是否真实?" 等精细查询能力,这些能力超出了预训练 MLLM 的能力。广泛的实验表明,TruthLens 在各种数据集上均创下了在 Forensic 可解释性和检测准确性方面的新纪录,能够泛化到看得见和看不见的操控方式。通过将高层次场景理解与细粒度区域 grounding 统一,TruthLens 为深度伪造的透明 forensics 铺平了关键性文献中的空白。
引用
@article{arxiv.2503.15867,
title = {TruthLens: Visual Grounding for Universal DeepFake Reasoning},
author = {Rohit Kundu and Shan Jia and Vishal Mohanty and Athula Balachandran and Amit K. Roy-Chowdhury},
journal= {arXiv preprint arXiv:2503.15867},
year = {2025}
}