通过激活引导实现视觉语言模型中可配置的拒绝机制
计算机视觉与模式识别
2026-02-10 v1 人工智能
机器学习
摘要
随着视觉语言模型(VLM)的快速发展,拒绝机制已成为确保模型行为负责任和安全的关键组件。然而,现有拒绝策略大多“通用”,难以适应不同用户需求和情境限制,导致过度或不足的拒绝。本文首先探讨上述挑战,提出可配置拒绝于VLM(CR-VLM),一种基于激活引导实现可配置拒绝的鲁棒且高效的方法。CR-VLM由三个集成组件构成:(1)通过教师强制机制提取可配置的拒绝向量以放大拒绝信号;(2)引入门控机制,通过保留对范围内查询的接受来缓解过度拒绝;(3)设计反事实视觉增强模块,将视觉表征与拒绝要求对齐。跨多个数据集和各种VLM的全面实验表明,CR-VLM实现了有效、高效且鲁棒的可配置拒绝,为VLM的用户自适应安全对齐提供了可扩展的路径。
引用
@article{arxiv.2602.07013,
title = {Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models},
author = {Jiaxi Yang and Shicheng Liu and Yuchen Yang and Dongwon Lee},
journal= {arXiv preprint arXiv:2602.07013},
year = {2026}
}