生成人脸图像篡改归因报告:一个数据集和基线
计算机视觉与模式识别
2026-04-21 v3 人工智能
摘要
现有的面部伪造检测方法通常侧重于二分类或像素级定位,为人们对篡改性质提供的语义见解有限。为此,我们引入了伪造归因报告生成 (Forgery Attribution Report Generation),一种新的多模态任务,联合定位伪造区域(“Where”)和生成基于编辑过程的自然语言解释(“Why”)。这种双重关注方法超越了传统的 Forensic 方法,提供了对篡改的全面理解。为支持该领域的研究,我们present了一种大型数据集Multi-Modal Tamper Tracing (MMTT),包含152,217个样本,每个样本都有基于过程的 ground-truth mask 和 human-authored 文本描述,确保高注释精度和语言丰富性。我们进一步提出了ForgeryTalker,一个统一的端到端框架,通过共享编码器(图像编码器 + Q-former)和用于 mask 和 text 生成的双解码器集成视觉和语言,实现连贯的跨模态推理。实验表明,ForgeryTalker在 report generation 和伪造定位两个子任务上均实现了有竞争力的性能,即59.3 CIDEr 和73.67 IoU,为可解释的多媒体 Forensic 树立了基准。数据集和代码将被公开,以促进未来研究。
引用
@article{arxiv.2412.19685,
title = {Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline},
author = {Jingchun Lian and Lingyu Liu and Yaxiong Wang and Yujiao Wu and Lianwei Wu and Li Zhu and Zhedong Zheng},
journal= {arXiv preprint arXiv:2412.19685},
year = {2026}
}
备注
Accepted to ACL 2026 (Main Conference). This version includes camera-ready revisions and updated experimental results