中文

面向多模态大语言模型的词典对齐概念控制

机器学习 2026-04-13 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)已被证明对可能引发不安全响应的恶意查询十分脆弱。最近的工作通过提示工程、响应分类或微调来提高 MLLM 的安全性,但这些方法往往对不断演变的恶意模式无效,可能需要重新运行查询,或需要巨大的计算资源。对冻结模型在推理时进行激活引导最近涌现出一种灵活且有效的解决方案。然而,现有的 MLLM 引导方法通常仅处理有限的安全相关概念,或难以在不影响其他概念的情况下调整特定概念。为此,我们提出了字典对齐概念控制(DACO)框架,利用精选概念词典和稀疏自动编码器(SAE)提供对 MLLM 激活的粒度控制。首先,我们通过检索超过 40 万个标题-图像刺激,将其激活汇总为概念方向,构建 15,000 个多模态概念的词典,命名为 DACO-400K 数据集。其次,我们展示了精选词典可用于稀疏编码干预激活。最后,我们提出一种新颖的引导方法,利用词典初始化 SAE 训练,自动为 SAE 原子标注语义,以实现 MLLM 的安全控制。在多个 MLLM(如 QwenVL、LLaVA、InternVL)上的实验表明,DACO 在诸多安全基准(如 MM-SafetyBench、JailBreakV)上显著提高了 MLLM 的安全性,同时保持了通用功能。

关键词

引用

@article{arxiv.2604.08846,
  title  = {Dictionary-Aligned Concept Control for Safeguarding Multimodal LLMs},
  author = {Jinqi Luo and Jinyu Yang and Tal Neiman and Lei Fan and Bing Yin and Son Tran and Mubarak Shah and René Vidal},
  journal= {arXiv preprint arXiv:2604.08846},
  year   = {2026}
}

备注

Accepted in CVPR 2026. Project page: https://peterljq.github.io/project/daco