ETA:基于推理时的评估与对齐视觉语言模型安全性
计算机视觉与模式识别
2025-02-11 v2 计算与语言
机器学习
摘要
视觉语言模型 (VLM) 已成为多模态智能的重要 backbone,但显著的安全挑战限制了其实际应用。尽管文本输入通常能得到有效保护,但对抗性视觉输入容易绕过 VLM 防御机制。现有防御方法要么资源密集,需要大量数据和计算,要么无法同时确保响应的安全性和实用性。为此,本文提出一种新的两阶段推理时对齐框架,即评估后对齐 (ETA):1) 评估输入视觉内容和输出响应,以在多模态环境中建立稳健的安全意识;2) 通过条件 VLMs 的生成分布以干扰前缀进行浅层和深层对齐,并进行句子级最佳-N搜索,以寻找最无害且最有帮助的生成路径。大量实验表明,ETA 在无害性、实用性和效率方面均优于基线方法,在跨模态攻击中降低了不安全率 87.5%,在 GPT-4 有用性评估中实现 96.6% 的胜-平局。代码已公开于 https://github.com/DripNowhy/ETA。
引用
@article{arxiv.2410.06625,
title = {ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time},
author = {Yi Ding and Bolian Li and Ruqi Zhang},
journal= {arXiv preprint arXiv:2410.06625},
year = {2025}
}
备注
29pages