资源受限下的对比视觉-语言预训练
计算机视觉与模式识别
2022-07-19 v3 多媒体
摘要
开创性的双编码器预训练工作(如CLIP和ALIGN)揭示了利用对比学习对齐多模态表示的潜力。然而,这些工作需海量数据与计算资源(如十亿级网络数据与数百个GPU),阻碍了资源有限的研究者进行复现与进一步探索。为此,我们提出一系列新方法,显著削减了沉重的资源依赖,使得在有限资源下开展双编码器多模态表示对齐成为可能。此外,我们提供了一个具有竞争力结果的可复现基线,称为ZeroVL,仅使用14M公开可获取的学术数据集与8块V100 GPU。另外,我们收集了100M网络数据用于预训练,并取得了与最先进方法相当或更优的结果,进一步证明了我们的方法在大规模数据上的有效性。我们希望本工作能为未来对比视觉-语言预训练研究提供有用的数据点与经验。代码见 https://github.com/zerovl/ZeroVL。
引用
@article{arxiv.2112.09331,
title = {Contrastive Vision-Language Pre-training with Limited Resources},
author = {Quan Cui and Boyan Zhou and Yu Guo and Weidong Yin and Hao Wu and Osamu Yoshie and Yubo Chen},
journal= {arXiv preprint arXiv:2112.09331},
year = {2022}
}
备注
Accepted to ECCV2022