注意力忽视视觉风险:多模态安全对齐的风险自适应驾驶
计算机视觉与模式识别
2026-03-30 v3
摘要
现代 AI 模型在多模态查询中(其中有害意图嵌入图像中)仍常常脆弱。广泛使用的安全对齐方法是使用大规模多模态安全数据集进行训练,但数据精选和训练成本常常令人望而却步。为缓解这些成本,最近探索了推理阶段的对齐方法,但它们往往缺乏对多样化多模态越狱的通用性,且因额外的前向传递用于响应细化或重型部署前校准而产生显著开销。本文识别出对安全关键图像区域的视觉注意力不足是多模态安全失效的关键原因之一。基于此洞见,我们提出了多模态风险自适应驾驶(MoRAS),通过简洁的视觉上下文增强对安全关键视觉注意力,以实现准确的多模态风险评估。该风险信号可用于风险自适应驾驶,以实现直接拒绝,从而降低推理开销并保持对多样化多模态越狱的通用性。值得注意的是,MoRAS 只需少量校准数据即可估计多模态风险,大幅降低部署前开销。我们在多个基准和 MLLM 主干模型上进行了各种实证验证,观察到该提出的 MoRAS 在缓解越狱、保持实用性和降低计算开销方面均一致优于最先进的推理时防御措施。
引用
@article{arxiv.2510.13698,
title = {Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment},
author = {Jonghyun Park and Minhyuk Seo and Chaewon Yeo and Jonghyun Choi},
journal= {arXiv preprint arXiv:2510.13698},
year = {2026}
}