中文

OmniVL-Guard Pro:面向全方位视觉语言鉴 Forgery 的工具增强智能体

计算机视觉与模式识别 2026-05-21 v2 人工智能

摘要

现有的视觉语言伪造检测与定位方法 operate under a closed-world paradigm, 假设验证可仅通过模型完成。然而,自包含的大规模多模态模型(MLLMs)受限于有限的参数知识、静态训练语料库以及有限的感知分辨率,在动态开放世界鉴 Forgery 场景中存在实际瓶颈——尤其是需要外部线索进行实时事件验证、以及需要对局部篡改进行细粒度审查的伪造分割。为此,我们从扩大自包含模型的规模转向超越模型本身。我们提出了 **OmniVL-Guard Pro**,一种工具增强型智能体,将统一鉴 Forgery 从封闭世界预测扩展至基于开放世界线索的推理。OmniVL-Guard Pro 集成了一个工具环境,涵盖实时事件搜索、局部裁剪与放大、边缘异常筛查、人脸检测、视频帧提取以及基于 SAM3 的分割。为生成高质量的工具推理轨迹,我们引入 **Tree-Structured Self-Evolving Tool Trajectory Generation**,通过种子引导、无向导自演化以及弱提示硬样本合成,产生多样化的轨迹,构建用于训练的 Full-Spectrum Tool Reasoning(FSTR)数据集。我们进一步提出 **Checker-Guided Agentic Reinforcement Learning**(CGARL),提供过程级监督,对答案正确但推理失真的情况进行惩罚。大量实验表明,OmniVL-Guard Pro 在各类任务上实现了状态-of-the-art 性能,并展现出强大的零样本泛化能力。OmniVL-Guard Pro 的 FSTR 数据集和代码将发布于 https://github.com/shen8424/OmniVL-Guard-Pro。

关键词

引用

@article{arxiv.2605.16962,
  title  = {OmniVL-Guard Pro: A Tool-Augmented Agent for Omnibus Vision-Language Forensics},
  author = {Jinjie Shen and Zheng Huang and Yuchen Zhang and Yujiao Wu and Yaxiong Wang and Lechao Cheng and Shengeng Tang and Tianrui Hui and Nan Pu and Zhun Zhong},
  journal= {arXiv preprint arXiv:2605.16962},
  year   = {2026}
}

备注

29 pages