中文

视觉语言模型中的似曾相识记忆

计算机视觉与模式识别 2024-10-30 v2 机器学习

摘要

视觉语言模型(VLM)已成为最先进的表示学习解决方案,具有大量下游应用,如图像分类、检索和生成。一个自然的问题是这些模型是否记住了它们的训练数据,这也对泛化有影响。我们提出了一种新的测量VLM中记忆化的方法,称为似曾相识记忆。对于在图像-标题对上训练的VLM,我们表明模型确实保留了训练图像中单个对象的信息,超出了从相关性或图像标题中可以推断的内容。我们在样本和总体水平上评估了似曾相识记忆,并表明对于在多达5000万图像-标题对上训练的OpenCLIP,这种记忆是显著的。最后,我们表明文本随机化显著减轻了记忆化,同时仅适度影响模型的下游任务性能。

关键词

引用

@article{arxiv.2402.02103,
  title  = {D\'ej\`a Vu Memorization in Vision-Language Models},
  author = {Bargav Jayaraman and Chuan Guo and Kamalika Chaudhuri},
  journal= {arXiv preprint arXiv:2402.02103},
  year   = {2024}
}