中文

利用单模态编码器进行视觉语言任务的多模态自适应蒸馏

计算机视觉与模式识别 2022-04-29 v2 人工智能 计算与语言 机器学习 多媒体

摘要

用于视觉语言(VL)任务的跨模态编码器通常在精心整理的视觉语言数据集上预训练。虽然这些数据集规模达到千万样本量级,但进一步扩展所需的标注成本令人望而却步。相反,单模态编码器使用成本较低的简单标注进行预训练,规模可达数亿至数十亿。因此,单模态编码器在许多下游任务上取得了最先进(SOTA)性能。然而,将其应用于 VL 任务时仍存在挑战:预训练数据对跨模态架构并非最优,且需要大量计算资源;此外,单模态架构缺乏已在 VL 任务中展现出显著收益的交叉模态交互。因此,如何最好地利用预训练的单模态编码器处理 VL 任务仍是活跃的研究领域。本工作中,我们提出一种利用单模态视觉与文本编码器处理 VL 任务的方法,可在保持计算复杂度不变的同时增强现有 VL 方法。具体而言,我们提出多模态自适应蒸馏(MAD),将预训练编码器中的有用知识自适应地蒸馏到跨模态 VL 编码器中。其次,为更好地捕捉对 VL 任务性能的细微影响,我们引入一种评估协议,涵盖视觉常识推理(VCR)、视觉蕴含(SNLI-VE)和视觉问答(VQA),并在多种数据约束与域偏移条件下进行评测。实验表明,MAD 在 VCR、SNLI-VE 和 VQA 的小样本、域偏移和全监督条件下均带来稳定提升,并在使用图文数据预训练的其他单模型中于 VCR 上取得 SOTA 性能。最后,MAD 优于同期利用 CLIP 预训练视觉编码器的工作。代码将公开。

关键词

引用

@article{arxiv.2204.10496,
  title  = {Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks},
  author = {Zhecan Wang and Noel Codella and Yen-Chun Chen and Luowei Zhou and Xiyang Dai and Bin Xiao and Jianwei Yang and Haoxuan You and Kai-Wei Chang and Shih-fu Chang and Lu Yuan},
  journal= {arXiv preprint arXiv:2204.10496},
  year   = {2022}
}

备注

arXiv admin note: substantial text overlap with arXiv:2201.05729