动态标记重加权:稳健视觉语言模型的方法
计算机视觉与模式识别
2026-03-03 v3 计算与语言
摘要
大型视觉语言模型(VLM)对利用视觉-文本交互以规避安全警戒线的多模态越狱攻击极其脆弱。本文提出 DTR(Dynamic Token Reweighting),一种新颖的推理时防御方法,通过优化模型的关键值(KV)缓存来缓解多模态越狱攻击。我们提出了安全相关分布性偏移的新表述,这一表述使 DTR 能够动态调整视觉标记权重,在保留模型通用能力和推理效率的同时,最小化对对抗性视觉输入的影响。广泛的评估表明,DTR 在攻击鲁棒性和良性任务性能方面均优于现有防御方法,标志着首次成功地将 KV 缓存优化应用于多模态基础模型的安全增强。DTR 的代码可在 https://github.com/TanqiuJiang/DTR 获取。
引用
@article{arxiv.2505.17132,
title = {Dynamic Token Reweighting for Robust Vision-Language Models},
author = {Tanqiu Jiang and Jiacheng Liang and Rongyi Zhu and Jiawei Zhou and Fenglong Ma and Ting Wang},
journal= {arXiv preprint arXiv:2505.17132},
year = {2026}
}
备注
CVPR 2026