中文

I-Tuning:利用图像微调冻结语言模型实现轻量级图像描述

计算与语言 2023-03-14 v3 计算机视觉与模式识别

摘要

图像描述是一项传统的视觉与语言任务,旨在生成图像的语言描述。近期研究聚焦于扩大模型规模与训练数据量,显著增加了模型训练成本。与这些高成本模型不同,我们引入了一种轻量级图像描述框架(I-Tuning),其包含少量可训练参数。我们设计了一种新颖的 I-Tuning 交叉注意力模块,以连接不可训练的预训练语言解码器 GPT2 与视觉编码器 CLIP-ViT。由于大多数参数在训练期间无需更新,我们的框架轻量且快速。在三个图像描述基准上进行的实验结果表明,我们的框架取得了与大规模基线系统相当或更优的性能。但相较于 SOTA 基线,我们的模型可训练参数最多减少 10 倍,且所需训练数据量少得多。

关键词

引用

@article{arxiv.2202.06574,
  title  = {I-Tuning: Tuning Frozen Language Models with Image for Lightweight Image Captioning},
  author = {Ziyang Luo and Zhipeng Hu and Yadong Xi and Rongsheng Zhang and Jing Ma},
  journal= {arXiv preprint arXiv:2202.06574},
  year   = {2023}
}

备注

ICASSP 2023