中文

通过自蒸馏编码器加速对比语言-图像预训练

计算机视觉与模式识别 2023-12-21 v1

摘要

视觉语言预训练(VLP)的最新进展很大程度上归功于从网络收集的大规模数据。然而,未经筛选的数据集包含弱相关的图像-文本对,导致数据效率低下。为了解决这个问题,人们在知识蒸馏方面进行了探索,代价是使用额外的图像和文本动量编码器来为未对齐的图像-文本对生成教学信号。在本文中,我们的目标是通过一个高效的蒸馏框架来解决未对齐问题。为此,我们提出了 ECLIPSE:通过自蒸馏编码器加速对比语言-图像预训练。ECLIPSE 具有独特的蒸馏架构,其中在线图像编码器和动量图像编码器之间共享一个文本编码器。这种策略性的设计选择使得蒸馏能够在统一的文本嵌入投影空间内进行,从而带来更好的性能。基于统一的文本嵌入空间,ECLIPSE 通过加速在线图像编码器来补偿动量图像编码器的额外计算成本。通过我们广泛的实验,我们验证了在加速和蒸馏之间存在一个最佳平衡点,加速后的在线图像编码器的局部视图与动量教师互补地相互作用。因此,ECLIPSE 在实现推理速度大幅加快的同时,性能优于同类方法。

关键词

引用

@article{arxiv.2312.12659,
  title  = {Expediting Contrastive Language-Image Pretraining via Self-distilled Encoders},
  author = {Bumsoo Kim and Jinhyung Kim and Yeonsik Jo and Seung Hwan Kim},
  journal= {arXiv preprint arXiv:2312.12659},
  year   = {2023}
}

备注

AAAI 2024