语言量化自编码器:面向无监督文本-图像对齐
机器学习
2023-02-06 v2 计算与语言
计算机视觉与模式识别
摘要
近期大规模语言模型扩展的进展已展现出在广泛基于文本的任务中执行少样本学习的惊人能力。然而,一个关键限制是这些语言模型从根本上缺乏视觉感知——这是将这些模型扩展到能够与真实世界交互并解决视觉任务(如视觉问答和机器人)所需的关键属性。先前的工作主要通过在精心整理的图像-文本数据集上预训练和/或微调来连接图像与文本,这可能是一个昂贵且耗费资源的过程。为解决此限制,我们提出一种简单而有效的方法,称为语言量化自编码器(LQAE),它是VQ-VAE的一种改进,通过利用预训练语言模型(如BERT、RoBERTa)以无监督方式学习对齐文本-图像数据。我们的主要思想是使用预训练语言码本直接量化图像嵌入,将图像编码为文本token序列。然后我们应用随机掩码并接一个BERT模型,让解码器从BERT预测的文本token嵌入中重建原始图像。通过这样做,LQAE学习用相似的文本token簇表示相似图像,从而在没有对齐文本-图像对的情况下对齐这两种模态。这使得利用大语言模型(如GPT-3)进行少样本图像分类以及基于BERT文本特征的图像线性分类成为可能。据我们所知,我们的工作是首个利用未对齐图像并通过预训练语言模型能力处理多模态任务的工作。
引用
@article{arxiv.2302.00902,
title = {Language Quantized AutoEncoders: Towards Unsupervised Text-Image Alignment},
author = {Hao Liu and Wilson Yan and Pieter Abbeel},
journal= {arXiv preprint arXiv:2302.00902},
year = {2023}
}
备注
Fixed typos