通过视觉-语言知识蒸馏在 CLIP 上实现多模态生成
计算与语言
2022-03-31 v2 人工智能
计算机视觉与模式识别
摘要
近期以海量图文对数据对双流架构(如 CLIP)进行的大规模视觉-语言预训练(VLP),已在多种多模态对齐任务上展现出优越性。尽管取得成功,由于文本编码器较弱,所得模型不具备多模态生成任务的能力。为解决该问题,我们提出通过视觉-语言知识蒸馏(VLKD)用文本预训练语言模型(PLM)增强双流 VLP 模型,从而赋予多模态生成能力。与从头预训练相比,VLKD 在数据与计算上均极为高效。实验结果表明,所得模型在多模态生成任务(如开放式视觉问答与图像描述)上具有强大的零样本性能。例如,其在 VQAv2 数据集上取得 44.5% 的零样本准确率,以 更少的参数超越先前最先进的零样本模型。此外,PLM 原有的文本语言理解与生成能力在 VLKD 后得以保持,这使我们的模型可通用于多模态与单模态任务。
引用
@article{arxiv.2203.06386,
title = {Enabling Multimodal Generation on CLIP via Vision-Language Knowledge Distillation},
author = {Wenliang Dai and Lu Hou and Lifeng Shang and Xin Jiang and Qun Liu and Pascale Fung},
journal= {arXiv preprint arXiv:2203.06386},
year = {2022}
}
备注
Accepted to ACL 2022