中文

使用生成数据集进行正则化训练以实现视觉语言模型的仅名称迁移

计算机视觉与模式识别 2024-06-11 v1

摘要

文本到图像生成的最新进展激发了研究人员使用生成模型为感知模型定制数据集,这在真实世界数据有限的场景中尤其有价值。在本研究中,我们的目标是解决在生成数据集上微调视觉语言模型(例如CLIP)时面临的挑战。具体来说,我们旨在将视觉语言模型微调为一个特定的分类模型,而无需访问任何真实图像,这也被称为仅名称迁移。然而,尽管生成图像具有高保真度,但由于真实图像与生成图像之间存在域差距,我们观察到使用生成数据集微调模型时性能显著下降。为了克服域差距,我们分别提供了训练和训练后的两种正则化方法。首先,我们通过在训练后对生成数据集上微调的模型与原始预训练模型进行权重空间集成,利用原始预训练视觉语言模型中与域无关的知识。其次,我们揭示出具有高特征多样性的微调模型在真实域中表现优异,这表明增加特征多样性可以防止学习特定于生成域的知识。因此,我们在训练时通过提供额外的正则化来鼓励特征多样性。在各种分类数据集和各种文本到图像生成模型上进行的大量实验表明,我们的分析和正则化技术有效地缓解了长期被忽视的域差距,并使我们能够通过使用生成图像进行训练来实现最先进的性能。代码可在 https://github.com/pmh9960/regft-for-gen 获取。

关键词

引用

@article{arxiv.2406.05432,
  title  = {Regularized Training with Generated Datasets for Name-Only Transfer of Vision-Language Models},
  author = {Minho Park and Sunghyun Park and Jooyeol Yun and Jaegul Choo},
  journal= {arXiv preprint arXiv:2406.05432},
  year   = {2024}
}

备注

Preprint. Under review