中文

SafeCoT:通过最小推理提高视觉语言模型的安全性

人工智能 2025-06-12 v2 机器学习

摘要

确保视觉语言模型(VLM)在高风险或模糊场景中的安全且合适的响应仍是一个关键挑战。我们引入 SafeCoT,一个轻量且可解释的框架,利用基于规则的链式推理(Chain-of-Thought)监督来提高 VLM 的拒绝行为。与依赖大规模安全标注或复杂建模的先前方法不同,SafeCoT 使用最小化的监督帮助模型推理关于安全风险的事实,作出情境感知的拒绝决策。跨多个基准的实验表明,SafeCoT显著减少了过度拒绝,增强了泛化能力,即使在有限训练数据的情况下亦如此。我们的做法为实现 VLM 与安全关键目标的对齐提供了可扩展的解决方案。

关键词

引用

@article{arxiv.2506.08399,
  title  = {SafeCoT: Improving VLM Safety with Minimal Reasoning},
  author = {Jiachen Ma and Zhanhui Zhou and Chao Yang and Chaochao Lu},
  journal= {arXiv preprint arXiv:2506.08399},
  year   = {2025}
}