中文

TextShield-R1:基于强化学习的篡改文本检测

计算机视觉与模式识别 2026-02-24 v1

摘要

篡改图像的日益增长暴露了严重的安全威胁,凸显了可靠检测方法的紧迫需求。多模态大语言模型(MLLM)在分析篡改图像和生成解释方面显示出强大的潜力。然而,它们仍在识别微观层次的痕迹方面困难,局化篡改文本区域的准确率较低,以及依赖昂贵的 forgery 解释注释。为此,我们引入TextShield-R1,这是首个基于强化学习的 MLLM 解决方案,用于篡改文本检测和推理。具体而言,我们的方法引入了 Forensic Continual Pre-training,即一种易于难度递进的课程,充分利用自然图像 forensic 和 OCR 任务中大规模廉价数据,为 MLLM 做好篡改文本检测准备。在微调过程中,我们采用带有新颖奖励函数的 Group Relative Policy Optimization,以减少注释依赖并提高推理能力。在推理时,我们通过 OCR Rectification 方法利用 MLLM 强大的文本识别能力来细化预测,从而提高局化准确性。此外,为支持严格评估,我们引入了 Text Forensics Reasoning(TFR)基准,包含45000多幅真实和篡改图像,覆盖16种语言、10种篡改技术以及多样化领域。包含丰富的推理风格注释,允许进行全面评估。我们的 TFR 基准同时解决了现有基准的七个主要局限性,使其能够在跨风格、跨方法和跨语言条件下进行稳健评估。大量实验表明,TextShield-R1 在可解释篡改文本检测方面显著推动了技术进步。

关键词

引用

@article{arxiv.2602.19828,
  title  = {TextShield-R1: Reinforced Reasoning for Tampered Text Detection},
  author = {Chenfan Qu and Yiwu Zhong and Jian Liu and Xuekang Zhu and Bohan Yu and Lianwen Jin},
  journal= {arXiv preprint arXiv:2602.19828},
  year   = {2026}
}

备注

AAAI 2026