ASIF:耦合数据无需训练即可将单模态模型转为多模态
机器学习
2023-11-13 v3 人工智能
计算机视觉与模式识别
摘要
CLIP 证明了对齐视觉与语言空间是在无需显式训练的情况下解决许多视觉任务的关键,但需要在海量数据集上从头训练图像和文本编码器。LiT 通过仅训练文本编码器并使用预训练视觉网络改进了这一点。在本文中,我们表明可以完全不需任何训练,利用单域编码器(有监督或无监督训练)和更少量的图像-文本对来创建公共空间。此外,我们的模型具有独特属性。最值得注意的是,部署带有更新训练样本的新版本只需数秒。另外,公共空间中的表示易于解释,因为每个维度对应于输入与多模态数据集中唯一图像-文本对的相似度。在标准零样本视觉基准上的实验展示了图像-文本模型典型的迁移能力。总体而言,我们的方法代表了基础多模态模型一个简单却令人惊讶地强大的基线,对它们的数据效率以及检索在机器学习中的作用提出了重要问题。
引用
@article{arxiv.2210.01738,
title = {ASIF: Coupled Data Turns Unimodal Models to Multimodal Without Training},
author = {Antonio Norelli and Marco Fumero and Valentino Maiorca and Luca Moschella and Emanuele Rodolà and Francesco Locatello},
journal= {arXiv preprint arXiv:2210.01738},
year = {2023}
}
备注
17 pages