中文

自感知安全增强:利用内部语义理解提升视觉-语言模型的安全性

人工智能 2025-07-30 v1

摘要

大型视觉-语言模型(LVLMs)与其纯语言骨干模型相比,更容易受到有害输入的影响。我们通过探索LVLMs的内部动态来研究这一脆弱性,将其固有的安全理解能力归结为三个关键能力。具体来说,我们将这些能力定义为安全感知、语义理解和语言表达对齐,并通过实验确定了它们在模型架构中的主要位置。结果表明,安全感知通常出现在全面的语义理解之前,这导致了安全性的降低。受这些发现的启发,我们提出了\textbf{自感知安全增强(SASA)}技术,该技术将来自中间层的信息性语义表示投影到更早的安全导向层上。这种方法利用模型固有的语义理解来增强安全识别,而无需微调。然后,我们采用线性探测来阐明模型的内部语义理解,以便在生成过程之前检测风险。在各种数据集和任务上的大量实验表明,SASA显著提高了LVLMs的安全性,同时对实用性的影响极小。

关键词

引用

@article{arxiv.2507.21637,
  title  = {Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models},
  author = {Wanying Wang and Zeyu Ma and Han Zheng and Xin Tan and Mingang Chen},
  journal= {arXiv preprint arXiv:2507.21637},
  year   = {2025}
}

备注

Accepted by ACM Multimedia 2025