VisualGPT:面向图像描述的数据高效预训练语言模型适配方法
计算机视觉与模式识别
2022-03-31 v5 人工智能
计算与语言
多媒体
摘要
从少量训练数据中快速学习的能力拓宽了机器学习应用的范围。本文提出一种数据高效的图像描述模型 VisualGPT,其利用了来自大型预训练语言模型(LM)的语言知识。一个关键挑战在于平衡图像中视觉信息的使用与从预训练获得的先验语言知识。我们设计了一种新颖的自复苏编码器-解码器注意力机制,以在少量领域内训练数据上快速将预训练 LM 适配为语言解码器。所提出的自复苏激活单元产生稀疏激活,但对零梯度的敏感性降低。我们在 MSCOCO 和 Conceptual Captions 训练数据的 0.1%、0.5% 和 1% 上训练所提出的 VisualGPT 模型。在这些条件下,我们在 MS COCO 上比最佳基线模型高出至多 10.8% CIDEr,在 Conceptual Captions 上高出至多 5.4% CIDEr。此外,VisualGPT 在医学报告生成数据集 IU X-ray 上取得了最先进(state-of-the-art)结果。据我们所知,这是首项通过利用在单模态数据上预训练的 LM 来提升图像描述数据效率的工作。我们的代码可在 https://github.com/Vision-CAIR/VisualGPT 获取。
引用
@article{arxiv.2102.10407,
title = {VisualGPT: Data-efficient Adaptation of Pretrained Language Models for Image Captioning},
author = {Jun Chen and Han Guo and Kai Yi and Boyang Li and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2102.10407},
year = {2022}
}