通过参数高效迁移学习实现视觉与语言的对齐
计算机视觉与模式识别
2023-03-22 v1
摘要
对比视觉-语言模型(如 CLIP)通常通过对视觉模型与语言模型的所有参数进行对比训练来创建。此类模型能否通过对已训练的语言模型和视觉模型进行少量参数更新来创建?文献中描述了通过对语言模型中少量参数进行更新来创建视觉-语言模型的技术,但这些技术需要已对齐的视觉表示且为非对比的,因此无法用于神经搜索等延迟敏感应用。我们探索了通过迁移学习进行参数高效的对比视觉-语言对齐的可行性与益处:即通过最小限度更新已训练的视觉与语言模型来创建如 CLIP 的模型。我们发现,极少的参数更新(<7%)即可达到与全模型训练相同的性能,而更新特定组件(<1% 的参数)可匹配全模型训练的 75%。我们描述了一系列实验:表明在参数高效训练中既有知识被更强地保留,且参数高效缩放随模型与数据集规模而扩展。在配对图像-文本数据稀缺但存在强多语言语言模型(如低资源语言)的情况下,参数高效训练甚至优于全模型训练。在给定固定计算预算时,参数高效训练允许在相同硬件上训练更大模型,以更短时间达到等效性能。因此,参数高效训练构成了一种节能且高效的对比视觉-语言模型训练策略,对于常见用例可能优于全模型训练范式。代码与权重见 https://github.com/codezakh/LilT。
引用
@article{arxiv.2303.11866,
title = {Contrastive Alignment of Vision to Language Through Parameter-Efficient Transfer Learning},
author = {Zaid Khan and Yun Fu},
journal= {arXiv preprint arXiv:2303.11866},
year = {2023}
}
备注
Accepted to ICLR 2023