面向 AI 文档安全的证据导向智能体推理——DocShield
计算机视觉与模式识别
2026-04-06 v1 人工智能
摘要
生成式 AI 的快速发展使得基于文本的图像伪造日益逼真,构成文档安全的重大挑战。现有 Forensic 方法主要依赖视觉线索,缺乏证据基础推理以揭示细微文本操作。检测、局部化和解释常被视为孤立任务,限制了可靠性和可解释性。为此,我们提出 DocShield,首个将文本导向性伪造分析形式化为视觉-逻辑共推理问题的统一框架。其核心, novel Cross-Cues-aware Chain of Thought(CCT)机制实现隐式智能体推理,迭代交叉验证视觉异常与文本语义,以产出一致且基于证据的 Forensic 分析。我们进一步引入加权多任务奖励,用于 GRPO-based 优化,使推理结构、空间证据和真实性预测实现对齐。配套该框架,我们构建 RealText-V1,一个包含文档式文本图像的多语言数据集,提供像素级操纵掩码和专家级文本解释。大量实验表明,DocShield 在 T-IC13 上显著优于现有方法,宏平均 F1 提升 41.4%,相对于 GPT-4o 提升 23.4%,在具备挑战性的 T-SROIE 数据集上也持续获得提升。我们的数据集、模型和代码将公开释放。
关键词
引用
@article{arxiv.2604.02694,
title = {DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning},
author = {Fanwei Zeng and Changtao Miao and Jing Huang and Zhiya Tan and Shutao Gong and Xiaoming Yu and Yang Wang and Weibin Yao and Joey Tianyi Zhou and Jianshu Li and Yin Yan},
journal= {arXiv preprint arXiv:2604.02694},
year = {2026}
}
备注
10 pages, 4 figures, 5 tables. Preprint