中文

GuardTrace-VL:通过迭代安全监督检测不安全的多模态推理

计算机视觉与模式识别 2025-11-27 v1 人工智能 密码学与安全

摘要

多模态大型推理模型(MLRM)越来越多地被部署用于产生显式中间推理过程的视觉-语言任务。然而,即使最终答案无害,推理过程也可能包含不安全内容,从而带来部署风险。现有的多模态安全防护主要仅评估输入问题和最终答案,忽略了中间推理过程。这种疏忽使得未被检测到的危害,例如有偏见的推断或违反策略的视觉上下文使用,在推理过程中出现。我们引入了 GuardTrace-VL,这是一种视觉感知的安全审计器,它通过联合图像-文本分析监控完整的“问题-思考-答案”(QTA)流程,从而能够在推理阶段出现不安全内容时进行检测。为了支持训练和评估,我们构建了 GuardTrace 数据集,该数据集通过多样化的提示策略生成,并通过基于 MLRM 和人工的投票与验证流程进行精炼。此外,我们提出了一种三阶段渐进式训练方案,结合数据精炼过程,使模型能够根据不同的风险级别学习细致入微且上下文相关的安全偏好。在我们提出的涵盖域内和域外场景的测试集上,GuardTrace-VL 模型在不安全推理检测任务上取得了 93.1% 的 F1 分数,与之前最强的多模态安全防御方法相比,F1 分数提高了 13.5%。代码将公开发布。

关键词

引用

@article{arxiv.2511.20994,
  title  = {GuardTrace-VL: Detecting Unsafe Multimodel Reasoning via Iterative Safety Supervision},
  author = {Yuxiao Xiang and Junchi Chen and Zhenchao Jin and Changtao Miao and Haojie Yuan and Qi Chu and Tao Gong and Nenghai Yu},
  journal= {arXiv preprint arXiv:2511.20994},
  year   = {2025}
}