无平行图像与描述文本的无监督视觉-语言预训练
计算与语言
2021-04-13 v2 计算机视觉与模式识别
机器学习
摘要
预训练的上下文视觉-语言(V&L)模型已在多项基准上取得令人印象深刻的性能。然而,现有模型需要大量平行图像-描述文本数据用于预训练。此类数据收集成本高昂且需繁琐的筛选。受无监督机器翻译启发,我们探究是否可通过无监督预训练、在无图像-描述语料的情况下学习到强大的 V&L 表示模型。具体而言,我们提出在仅文本与仅图像语料上执行“掩码并预测”预训练,并引入由物体识别模型检测出的物体标签作为锚点以桥接两种模态。我们发现,在四个英文 V&L 基准上,这一简单方法取得了与基于对齐数据预训练的模型相近的性能。我们的工作挑战了“对齐数据对 V&L 预训练必不可少”这一广泛持有的观念,同时显著减少 V&L 模型所需的监督量。
引用
@article{arxiv.2010.12831,
title = {Unsupervised Vision-and-Language Pre-training Without Parallel Images and Captions},
author = {Liunian Harold Li and Haoxuan You and Zhecan Wang and Alireza Zareian and Shih-Fu Chang and Kai-Wei Chang},
journal= {arXiv preprint arXiv:2010.12831},
year = {2021}
}
备注
NAACL 2021 Camera Ready