利用检索增强知识学习定制化视觉模型
计算机视觉与模式识别
2023-01-18 v1 人工智能
计算与语言
机器学习
摘要
诸如 CLIP 之类的图像-文本对比学习模型已展现出强大的任务迁移能力。这些视觉模型的高通用性和可用性是通过网络规模的数据收集过程以确保广泛的概念覆盖,随后进行昂贵的预训练以将所有知识注入模型权重来实现的。作为替代,我们提出 REACT(REtrieval-Augmented CusTomization,检索增强定制化),一个从网络获取相关知识以为目标领域构建定制化视觉模型的框架。我们从网络规模数据库中检索最相关的图像-文本对(约为 CLIP 预训练数据的 3%)作为外部知识,并提出仅训练新的模块化块同时冻结所有原始权重来定制化模型。REACT 的有效性通过分类、检索、检测和分割任务(包括零样本、少样本和全样本设置)上的大量实验得到证明。特别是在零样本分类任务上,与 CLIP 相比,它在 ImageNet 上实现了高达 5.4% 的提升,在 ELEVATER 基准(20 个数据集)上实现了 3.7% 的提升。
引用
@article{arxiv.2301.07094,
title = {Learning Customized Visual Models with Retrieval-Augmented Knowledge},
author = {Haotian Liu and Kilho Son and Jianwei Yang and Ce Liu and Jianfeng Gao and Yong Jae Lee and Chunyuan Li},
journal= {arXiv preprint arXiv:2301.07094},
year = {2023}
}