中文

AmorLIP:通过摊销实现语言-图像预训练的高效方法

机器学习 2025-10-23 v2 计算机视觉与模式识别

摘要

对比语言-图像预训练(CLIP)已在多样化的下游文本-图像任务中显示出强大的零shot性能。现有的CLIP方法通常使用从每个minibatch中抽取的负样本来优化对比目标。为实现稳健的表示学习,这些方法需要极大的batch size,并将计算需求推高到数百乃至数千个GPU。以往的解决方法往往妥协下游性能、延长训练时间,或在面对非常大的数据集时面临可扩展性挑战。为克服这些限制,我们提出AmorLIP,一种高效的CLIP预训练框架,通过对对比学习中昂贵的计算进行摊销,利用轻量级神经网络显著提高训练效率和性能。我们利用能量基模型谱分解的见解,引入新的摊销目标,并提出实用技巧以提高训练稳定性。广泛的实验在38个下游任务上表明,AmorLIP在零shot分类和检索方面优于标准CLIP基线,始终以相当程度的提升(最高可达12.24%)表现优异。

关键词

引用

@article{arxiv.2505.18983,
  title  = {AmorLIP: Efficient Language-Image Pretraining via Amortization},
  author = {Haotian Sun and Yitong Li and Yuchen Zhuang and Niao He and Hanjun Dai and Bo Dai},
  journal= {arXiv preprint arXiv:2505.18983},
  year   = {2025}
}