离散图像标记器的对抗鲁棒性
计算机视觉与模式识别
2026-02-23 v1 人工智能
摘要
离散图像标记器将视觉输入编码为来自有限词汇表的标记序列,在多模态系统中受到越来越多的关注,包括编码器-only、编码器-解码器和解码器-only 模型。然而,与 CLIP 编码器不同,这些模型对对抗攻击的脆弱性尚未被探讨。本文是首次研究此话题的工作,我们首先构建旨在扰动离散标记器提取特征的攻击,从而改变提取的标记。这些攻击计算上高效、跨任务通用且在分类、多模态检索和描述生成任务中均有效。其次,为了应对这种脆弱性,借鉴近期关于鲁棒 CLIP 编码器的工作,我们在保持其他组件冻结的情况下,对流行的标记器进行基于无监督对抗训练的微调。虽然无监督且跨任务通用,但我们的做法显著提高了对无监督和端到端监督攻击的鲁棒性,并能良好推广至未见任务和数据。不同于监督对抗训练,我们的方法可以利用无标签图像,更加通用。总体而言,本工作凸显了标记器鲁棒性在下游任务中的关键作用,并为开发安全的多模态基础模型提供了重要一步。
引用
@article{arxiv.2602.18252,
title = {On the Adversarial Robustness of Discrete Image Tokenizers},
author = {Rishika Bhagwatkar and Irina Rish and Nicolas Flammarion and Francesco Croce},
journal= {arXiv preprint arXiv:2602.18252},
year = {2026}
}