DLIP:蒸馏语言-图像预训练
计算机视觉与模式识别
2023-08-25 v1 人工智能
机器学习
摘要
视觉-语言预训练(VLP)在极大量参数的辅助下取得了显著进展,这给实际部署带来了挑战。知识蒸馏被公认为模型压缩中的关键步骤。然而,现有知识蒸馏技术缺乏对 VLP 的深入调查与分析,且面向 VLP 的蒸馏实用准则尚待探索。本文中,我们提出 DLIP,一个简单而高效的知识蒸馏语言-图像预训练框架,借此探究如何蒸馏轻量 VLP 模型。具体而言,我们从多个维度剖析模型蒸馏,如不同模块的架构特性与不同模态的信息传递。我们进行了综合实验,并就蒸馏轻量且高性能的 VLP 模型提供了见解。实验结果表明,DLIP 能在多种跨模态任务(如图像-文本检索、图像描述与视觉问答)上实现 SOTA 的精度/效率权衡。例如,DLIP 将 BLIP 从 213M 参数压缩至 108M 参数(1.9倍),同时取得相当或更好的性能。此外,与教师模型相比,DLIP 以 22.4% 的参数和 24.8% 的 FLOPs 保留了超过 95% 的性能,并将推理速度加速 2.7 倍。
引用
@article{arxiv.2308.12956,
title = {DLIP: Distilling Language-Image Pre-training},
author = {Huafeng Kuang and Jie Wu and Xiawu Zheng and Ming Li and Xuefeng Xiao and Rui Wang and Min Zheng and Rongrong Ji},
journal= {arXiv preprint arXiv:2308.12956},
year = {2023}
}