中文

被标题捕获:CLIP 模型中的记忆及其缓解机制

计算机视觉与模式识别 2025-05-20 v2 人工智能 机器学习

摘要

诸如 CLIP 之类的多模态模型在 align 视觉和文本表示方面展现出了强大的性能,在图像检索和零样本分类等任务中表现优异。尽管取得了这些成功,但这些模型利用训练数据的机制,特别是记忆的作用,仍不清楚。在单模态模型中,无论是监督学习还是自监督学习,记忆已被证明对泛化能力至关重要。然而,这些发现如何适用于 CLIP 尚未被充分理解,因为 CLIP 既融合了监督学习的元素(通过提供类似于标签的监督信号的标题),也融合了自监督学习的元素(通过对比目标)。为了弥补这一理解上的空白,我们提出了 CLIP 中记忆的形式化定义(CLIPMem),并用它来量化 CLIP 模型中的记忆。我们的结果表明,CLIP 的记忆行为介于监督和自监督范式之间,其中“标题错误”的样本表现出最高水平的记忆。此外,我们发现文本编码器对记忆的贡献大于图像编码器,这表明缓解策略应侧重于文本领域。基于这些见解,我们提出了多种策略来减少记忆的同时提高效用——这在传统学习范式中尚未被证明,因为传统上减少记忆通常会导致效用下降。

关键词

引用

@article{arxiv.2502.07830,
  title  = {Captured by Captions: On Memorization and its Mitigation in CLIP Models},
  author = {Wenhao Wang and Adam Dziedzic and Grace C. Kim and Michael Backes and Franziska Boenisch},
  journal= {arXiv preprint arXiv:2502.07830},
  year   = {2025}
}

备注

Accepted at ICLR 2025