OmniVL-Guard:通过平衡强化学习实现统一视觉语言伪造检测与定位
计算机视觉与模式识别
2026-05-18 v3 人工智能
摘要
现有伪造检测方法常局限于单模态或双模态场景,无法处理现实信息扩散中常见的文本、图像与视频交叉出现的情况。为弥合这一差距,本文旨在开发一个统一框架,用于全模态视觉语言伪造检测与定位。在该统一设置下,不同模态之间的相互作用以及同时实现检测与定位的双重需求构成关键的“难度偏置”问题:较简单的真实性分类任务倾向于主导梯度,导致多任务优化期间细粒度定位性能 suboptimal。为解决此挑战,本文提出了 OmniVL-Guard,一个面向全模态视觉语言伪造检测与定位的平衡强化学习框架。具体而言,OmniVL-Guard包含两个核心设计:自演化思考链生成(Self-Evolving CoT Generation)与自适应奖励比例策略优化(Adaptive Reward Scaling Policy Optimization, ARSPO)。自演化思考链生成综合高质量推理路径,有效克服了冷启动挑战。基于此,自适应奖励比例策略优化动态调节奖励比例与任务权重,确保联合优化的平衡。大量实验表明,OmniVL-Guard显著优于最先进的方法,并在零样本条件下展现出对 out-of-domain 场景的鲁棒泛化。该项目的数据与代码已公开于 https://github.com/shen8424/OmniVL-Guard。
引用
@article{arxiv.2602.10687,
title = {OmniVL-Guard: Towards Unified Vision-Language Forgery Detection and Grounding via Balanced RL},
author = {Jinjie Shen and Jing Wu and Yaxiong Wang and Lechao Cheng and Shengeng Tang and Tianrui Hui and Nan Pu and Zhun Zhong},
journal= {arXiv preprint arXiv:2602.10687},
year = {2026}
}
备注
Accepted by ICML 2026