MiniVLM:更小更快的视觉-语言模型
计算机视觉与模式识别
2021-08-11 v2
摘要
近期的视觉-语言(VL)研究通过学习海量图文对的通用表征并采用transformer模型然后在下游VL任务上微调,取得了显著进展。尽管现有研究聚焦于利用大型预训练模型实现高准确率,构建轻量模型在实践中极具价值却较少被探索。本文提出一种更小更快的VL模型MiniVLM,它可像更大的同类模型一样在多种下游任务上以良好性能微调。MiniVLM由两个模块组成:视觉特征提取器与基于transformer的视觉-语言融合模块。受单阶段EfficientDet网络启发,我们设计了两阶段高效特征提取器(TEE),相较基线模型将视觉特征提取的时间成本显著降低95%。在比较不同紧凑BERT模型后,我们采用MiniLM结构降低transformer模块的计算成本。此外,我们通过加入由最先进captioning模型伪标注的7M Open Images数据改进MiniVLM预训练。我们还使用强标注模型获得的高质量图像标签进行预训练,以增强跨模态对齐。大模型离线使用,在微调与推理中不增加任何开销。借助上述设计选择,我们的MiniVLM将模型尺寸缩减73%、推理时间成本降低94%,同时能在多个VL任务上保留94–97%的准确率。我们希望MiniVLM有助于最先进VL研究在边缘应用中的便捷使用。
引用
@article{arxiv.2012.06946,
title = {MiniVLM: A Smaller and Faster Vision-Language Model},
author = {Jianfeng Wang and Xiaowei Hu and Pengchuan Zhang and Xiujun Li and Lijuan Wang and Lei Zhang and Jianfeng Gao and Zicheng Liu},
journal= {arXiv preprint arXiv:2012.06946},
year = {2021}
}