GrowCLIP:面向大规模对比语言-图像预训练的数据感知自动模型增长方法
计算机视觉与模式识别
2023-08-23 v1 人工智能
摘要
跨模态预训练在大量下游任务上展现出令人印象深刻的性能,这得益于从互联网收集的海量图像-文本对。在实践中,在线数据不断增长,这凸显了预训练模型从持续生长的数据中学习的能力的重要性。现有的跨模态预训练工作主要聚焦于训练具有固定架构的网络。然而,考虑到现实应用中预训练数据持续增长的特性,限制模型容量是不切实际的。另一方面,利用当前模型中的知识以获得高效训练与更优性能也很重要。为解决上述问题,本文提出 GrowCLIP,一种以连续图像-文本对作为输入、用于对比语言-图像预训练的数据驱动自动模型增长算法。具体而言,我们采用动态增长空间,并在每个增长步寻求最优架构以适应在线学习场景。我们在增长空间中提出共享编码器以增强跨模态融合程度。此外,我们探索了不同维度增长的影响,可为跨模态模型架构设计提供未来参考。最后,我们采用带动量的参数继承(PIM)来维持已有知识并解决局部极小困境。与现有方法相比,GrowCLIP 在 9 个下游任务的零样本图像分类上平均 top-1 准确率提升 2.3%。在零样本图像检索方面,GrowCLIP 在 Flickr30K 数据集上图像到文本 top-1 召回率提升 1.2%。
引用
@article{arxiv.2308.11331,
title = {GrowCLIP: Data-aware Automatic Model Growing for Large-scale Contrastive Language-Image Pre-training},
author = {Xinchi Deng and Han Shi and Runhui Huang and Changlin Li and Hang Xu and Jianhua Han and James Kwok and Shen Zhao and Wei Zhang and Xiaodan Liang},
journal= {arXiv preprint arXiv:2308.11331},
year = {2023}
}
备注
Accepted by ICCV2023