MOFI:从含噪实体标注图像中学习图像表示
计算机视觉与模式识别
2024-03-19 v3 计算与语言
机器学习
摘要
我们提出 MOFI(Manifold OF Images,图像流形),一种全新的视觉基础模型,旨在从含噪实体标注图像中学习图像表示。MOFI 与先前工作在两个关键方面有所不同:(i) 预训练数据,以及 (ii) 训练方案。在数据方面,我们引入一种新方法,从含噪图像-文本对中自动为图像分配实体标签。我们的方法采用命名实体识别模型从 alt-text 中提取实体,然后使用 CLIP 模型选择正确的实体作为配对图像的标签。这是一种简单、经济高效的方法,可扩展以处理数十亿网络挖掘的图像-文本对。通过该方法,我们创建了 Image-to-Entities(I2E)数据集,包含 10 亿图像和 200 万不同实体,涵盖真实场景中丰富的视觉概念。基于 I2E 数据集,我们研究了不同的训练方案,如监督预训练、对比预训练和 multitask learning。对于对比预训练,我们将实体名称视为自由形式文本,并用实体描述进一步丰富它们。实验表明,使用大规模细粒度实体标签进行监督预训练对图像检索任务极为有效,而多任务训练进一步提升了性能。最终的 MOFI 模型在具有挑战性的 GPR1200 数据集上达到 86.66% mAP,超越了 OpenAI 的 CLIP 模型先前 72.19% 的 SOTA 性能。在 zero-shot 和 linear probe 图像分类上的进一步实验也表明,MOFI 优于在原始图像-文本数据上训练的 CLIP 模型,证明了 I2E 数据集在学习强大图像表示方面的有效性。我们在 https://github.com/apple/ml-mofi 发布了代码和模型权重。
引用
@article{arxiv.2306.07952,
title = {MOFI: Learning Image Representations from Noisy Entity Annotated Images},
author = {Wentao Wu and Aleksei Timofeev and Chen Chen and Bowen Zhang and Kun Duan and Shuangning Liu and Yantao Zheng and Jonathon Shlens and Xianzhi Du and Zhe Gan and Yinfei Yang},
journal= {arXiv preprint arXiv:2306.07952},
year = {2024}
}
备注
Accepted to ICLR 2024