中文

SaFeR-ToolKit:基于虚拟工具调用的多模态安全结构化推理工具包

机器学习 2026-03-04 v1

摘要

视觉语言模型仍然容易受到多模态越狱和过度拒绝攻击,因为安全决策依赖于视觉证据和用户意图,而许多对齐管道仅监督最终响应。为此,我们提出了 SaFeR-ToolKit,通过形式化的协议来进行安全决策。具体而言,规划器指定一个角色、感知→推理→决策工具集,以及受约束的状态转换图,而响应器在最终答案输出前输出一个带类型 key-value 的工具轨迹。为确保协议在实践中可靠遵循,我们采用三阶段课程训练(SFT → DPO → GRPO),其中 GRPO 直接监督工具使用,超越仅答案级别的反馈。我们的贡献有两方面:I. 数据集。首个基于工具的安全推理数据集,包含 31,654 个示例(SFT 6k、DPO 18.6k、GRPO 6k)以及 1k 个 held-out 评估。II. 实验。在 Qwen2.5-VL 上,SaFeR-ToolKit 在 3B(29.39/45.04/4.98 → 84.40/71.13/78.87)和 7B(53.21/52.92/19.26 → 86.34/80.79/85.34)上显著提升了安全性/有用性/推理严谨性,同时保持了通用能力(3B: 58.67 → 59.21;7B: 66.39 → 66.81)。代码已公开于 https://github.com/Duebassx/SaFeR_ToolKit。

关键词

引用

@article{arxiv.2603.02635,
  title  = {SaFeR-ToolKit: Structured Reasoning via Virtual Tool Calling for Multimodal Safety},
  author = {Zixuan Xu and Tiancheng He and Huahui Yi and Kun Wang and Xi Chen and Gongli Xi and Qiankun Li and Kang Li and Yang Liu and Zhigang Zeng},
  journal= {arXiv preprint arXiv:2603.02635},
  year   = {2026}
}