中文

基于增量随机平滑的视觉-语言模型快速认证

计算机视觉与模式识别 2024-01-05 v2

摘要

CLIP 等深度视觉-语言模型的一个关键优势在于其支持零样本开放词汇分类;用户能够在推理时通过自然语言提示定义新的类别标签。然而,尽管基于 CLIP 的零样本分类器在一系列领域偏移中展现出具有竞争力的性能,它们仍然极易受到对抗攻击。因此,确保此类模型的鲁棒性对于其在真实场景中的可靠部署至关重要。在本工作中,我们提出开放词汇认证(OVC),一种通过随机平滑技术为 CLIP 等开放词汇模型设计的快速认证方法。给定一组基础的“训练”提示及其对应的已认证 CLIP 分类器,OVC 依赖于如下观察:带有新提示的分类器可被视为基础训练集中邻近分类器的扰动版本。因此,OVC 可利用增量随机平滑的一种变体快速认证该新分类器。通过使用缓存技巧,我们在新提示的认证过程中实现了约两个数量级的加速。为获得进一步的(启发式)加速,OVC 在给定输入处使用多元正态分布近似嵌入空间,从而免去通过视觉主干网络前向传播进行采样的需要。我们在 CIFAR-10 和 ImageNet 测试数据集上使用多个视觉-语言主干网络通过实验评估展示了 OVC 的有效性。

关键词

引用

@article{arxiv.2311.09024,
  title  = {Fast Certification of Vision-Language Models Using Incremental Randomized Smoothing},
  author = {A K Nirala and A Joshi and C Hegde and S Sarkar},
  journal= {arXiv preprint arXiv:2311.09024},
  year   = {2024}
}