中文

多模态基础模型零样本鲁棒性的基准测试:一项试点研究

机器学习 2024-03-18 v1 人工智能 计算与语言 计算机视觉与模式识别

摘要

从图像的原始文本中预训练图像表示,实现了向下游任务的零样本视觉迁移。通过在从互联网收集的数百万样本上进行预训练,CLIP 等多模态基础模型产生了最先进的零样本结果,这些结果通常无需特定任务训练即可达到与全监督方法相媲美的性能。除了在分类准确率上的令人鼓舞的表现外,据报道,这些模型通过匹配合在 ImageNet 上训练的监督模型在自然分布偏移下的性能,缩小了鲁棒性差距。由于鲁棒性对现实世界应用(尤其是安全关键应用)至关重要,在本文中,我们基于涵盖 7 种自然分布偏移、3 种合成分布偏移和 11 种对抗攻击的大规模鲁棒性基准进行了全面评估。我们以 CLIP 作为试点研究。我们表明,在我们的基准测试中,与有监督的 ImageNet 模型相比,CLIP 的鲁棒性显著下降,尤其是在合成分布偏移和对抗攻击下。此外,数据重叠分析表明,在自然分布偏移下观察到的鲁棒性至少部分可归因于数据重叠。总之,我们的评估表明有必要进行全面的鲁棒性评估;并且亟需提高零样本多模态模型的鲁棒性。

关键词

引用

@article{arxiv.2403.10499,
  title  = {Benchmarking Zero-Shot Robustness of Multimodal Foundation Models: A Pilot Study},
  author = {Chenguang Wang and Ruoxi Jia and Xin Liu and Dawn Song},
  journal= {arXiv preprint arXiv:2403.10499},
  year   = {2024}
}