LogicLens:面向以文本为中心的伪造分析的视觉-逻辑协同推理
人工智能
2025-12-29 v1
摘要
在 AIGC 快速发展的推动下,复杂的以文本为中心的伪造对社会安全和信息真实性构成了重大威胁。当前用于以文本为中心的伪造分析的方法通常局限于粗粒度的视觉分析,缺乏复杂推理的能力。此外,它们通常将检测、定位和解释视为离散的子任务,忽略了它们之间的内在关系以实现整体性能提升。为了应对这些挑战,我们引入了 LogicLens,这是一个统一的视觉-文本协同推理框架,将这些目标重新表述为一个联合任务。LogicLens 的深度推理由我们新颖的跨线索感知思维链(CCT)机制驱动,该机制将视觉线索与文本逻辑进行迭代交叉验证。为了确保所有任务间的稳健对齐,我们进一步提出了一种用于基于 GRPO 优化的加权多任务奖励函数。作为该框架的补充,我们首先设计了 PR(感知器、推理器、审查器)流水线,这是一个分层且迭代的多智能体系统,可生成高质量、认知对齐的标注。然后,我们构建了 RealText,这是一个包含 5,397 张图像的多样化数据集,带有细粒度标注,包括文本解释、像素级分割和用于模型训练的真实性标签。大量实验证明了 LogicLens 在多个基准测试上的优越性。在 T-IC13 上的零样本评估中,它在宏平均 F1 分数上比专用框架高出 41.4%,比 GPT-4o 高出 23.4%。此外,在具有挑战性的密集文本 T-SROIE 数据集上,它在 mF1、CSS 和宏平均 F1 上确立了相对于其他基于 MLLM 方法的显著领先地位。我们的数据集、模型和代码将公开发布。
引用
@article{arxiv.2512.21482,
title = {LogicLens: Visual-Logical Co-Reasoning for Text-Centric Forgery Analysis},
author = {Fanwei Zeng and Changtao Miao and Jing Huang and Zhiya Tan and Shutao Gong and Xiaoming Yu and Yang Wang and Huazhe Tan and Weibin Yao and Jianshu Li},
journal= {arXiv preprint arXiv:2512.21482},
year = {2025}
}
备注
11 pages, 5 figures, 3 tables