SafeCoT:通过最小推理提高视觉语言模型的安全性
人工智能
2025-06-12 v2 机器学习
摘要
确保视觉语言模型(VLM)在高风险或模糊场景中的安全且合适的响应仍是一个关键挑战。我们引入 SafeCoT,一个轻量且可解释的框架,利用基于规则的链式推理(Chain-of-Thought)监督来提高 VLM 的拒绝行为。与依赖大规模安全标注或复杂建模的先前方法不同,SafeCoT 使用最小化的监督帮助模型推理关于安全风险的事实,作出情境感知的拒绝决策。跨多个基准的实验表明,SafeCoT显著减少了过度拒绝,增强了泛化能力,即使在有限训练数据的情况下亦如此。我们的做法为实现 VLM 与安全关键目标的对齐提供了可扩展的解决方案。
引用
@article{arxiv.2506.08399,
title = {SafeCoT: Improving VLM Safety with Minimal Reasoning},
author = {Jiachen Ma and Zhanhui Zhou and Chao Yang and Chaochao Lu},
journal= {arXiv preprint arXiv:2506.08399},
year = {2025}
}