中文

VISOR++:基于通用视觉输入的大型视觉语言模型引导

计算机视觉与模式识别 2025-10-01 v1 人工智能

摘要

随着视觉语言模型(VLM)被部署于安全关键应用中,理解和控制其行为模式变得日益重要。现有的行为控制方法面临重大局限:系统提示方法很容易被用户指令覆盖,而应用基于激活的引导向量则需要对模型内部进行侵入性的运行时访问,这使其无法与基于 API 的服务和闭源模型一起部署。寻找能在多个 VLM 之间迁移的引导方法仍是一个开放的研究领域。为此,我们引入了用于输出重定向的基于通用视觉输入的引导(VISOR++),以仅通过优化的视觉输入实现行为控制。我们证明,可以为 VLM 集成体生成单一的 VISOR++ 图像,以模拟它们各自的引导向量。通过构造能够诱导目标激活模式的通用视觉输入,VISOR++ 消除了对运行时模型访问的需求,同时保持与部署方式无关。这意味着当底层模型支持多模态能力时,可以通过插入图像输入来引导模型行为,以替代基于运行时引导向量的干预。我们首先在 LLaVA-1.5-7B 和 IDEFICS2-8B 等开放获取模型上,沿着拒绝、阿谀奉承和生存本能这三个对齐方向展示了 VISOR++ 图像的有效性。无论是模型特定的引导图像还是联合优化的图像,在正向和负向引导任务中都实现了紧随引导向量之后的性能平价。我们还展示了 VISOR++ 图像在为未见模型(包括开放获取和闭源获取模型)实现方向性行为转变方面的前景。此外,VISOR++ 图像能够在 14,000 项无关的 MMLU 评估任务上保持 99.9% 的性能。

关键词

引用

@article{arxiv.2509.25533,
  title  = {VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models},
  author = {Ravikumar Balakrishnan and Mansi Phute},
  journal= {arXiv preprint arXiv:2509.25533},
  year   = {2025}
}