CLOOB:采用 InfoLOOB 的现代 Hopfield 网络超越 CLIP
机器学习
2022-11-08 v4 计算机视觉与模式识别
摘要
CLIP 在零样本迁移学习任务上取得了令人印象深刻的成果,并被视为如同 BERT 或 GPT3 一样的基础模型。具有丰富表示的 CLIP 视觉模型在使用 InfoNCE 目标函数和自然语言监督进行预训练后,再在特定任务上微调。尽管 CLIP 在零样本迁移学习中表现出色,但它存在一种“解释 away”问题,即它聚焦于一个或少数特征,而忽略其他相关特征。该问题源于对原始多模态数据中协方差结构提取不足。我们建议使用现代 Hopfield 网络来解决解释 away 问题。其检索到的嵌入具有由所存储嵌入中特征的共现推导出的丰富协方差结构。然而,现代 Hopfield 网络加剧了 InfoNCE 目标函数的饱和效应,从而妨碍学习。我们提出使用 InfoLOOB 目标函数来缓解这一饱和效应。我们引入了新颖的“对比留一提升”(CLOOB),它利用现代 Hopfield 网络进行协方差 enrichment,并结合 InfoLOOB 目标函数。在实验中,我们在 Conceptual Captions 和 YFCC 数据集上预训练后,针对其他数据集上的零样本迁移学习性能,将 CLOOB 与 CLIP 进行比较。在所有考虑的架构和数据集上,CLOOB 在零样本迁移学习中始终优于 CLIP。
引用
@article{arxiv.2110.11316,
title = {CLOOB: Modern Hopfield Networks with InfoLOOB Outperform CLIP},
author = {Andreas Fürst and Elisabeth Rumetshofer and Johannes Lehner and Viet Tran and Fei Tang and Hubert Ramsauer and David Kreil and Michael Kopp and Günter Klambauer and Angela Bitto-Nemling and Sepp Hochreiter},
journal= {arXiv preprint arXiv:2110.11316},
year = {2022}
}
备注
Published at NeurIPS 2022; Blog: https://ml-jku.github.io/cloob; GitHub: https://github.com/ml-jku/cloob