视觉语言模型中的似曾相识记忆
计算机视觉与模式识别
2024-10-30 v2 机器学习
摘要
视觉语言模型(VLM)已成为最先进的表示学习解决方案,具有大量下游应用,如图像分类、检索和生成。一个自然的问题是这些模型是否记住了它们的训练数据,这也对泛化有影响。我们提出了一种新的测量VLM中记忆化的方法,称为似曾相识记忆。对于在图像-标题对上训练的VLM,我们表明模型确实保留了训练图像中单个对象的信息,超出了从相关性或图像标题中可以推断的内容。我们在样本和总体水平上评估了似曾相识记忆,并表明对于在多达5000万图像-标题对上训练的OpenCLIP,这种记忆是显著的。最后,我们表明文本随机化显著减轻了记忆化,同时仅适度影响模型的下游任务性能。
引用
@article{arxiv.2402.02103,
title = {D\'ej\`a Vu Memorization in Vision-Language Models},
author = {Bargav Jayaraman and Chuan Guo and Kamalika Chaudhuri},
journal= {arXiv preprint arXiv:2402.02103},
year = {2024}
}