面向图像-语言学习的联合自适应表示
计算机视觉与模式识别
2023-06-02 v2
摘要
图像-语言学习在视觉理解方面取得了前所未有的进展。这些发展伴随着高昂代价,因为当代视觉-语言模型需要庞大的模型规模与海量数据。本文提出一种更为简便的图像-语言学习方案,其能产出高效模型,优于更大且更昂贵的、通常在数量级更大数据集上训练的模型。我们的核心发现是联合学习紧凑的视觉与语言表示,其自适应且迭代地融合多模态特征。这带来了更有效的图像-语言学习,通过合并并减少文本与图像的 token 数量大幅降低 FLOPs,例如相较流行图像-语言模型所用的基线融合技术实现了 33% 的 FLOPs 削减,同时提升性能。这也使模型能够在不大幅增加 FLOPs 或内存的情况下扩展。此外,我们提出自适应预训练数据采样以提升数据效率。所提方法相较远为庞大的模型取得了具竞争力的性能,且所用数据与 FLOPs 显著更少。仅以 4000 万训练样本与 39 GFLOPs,我们的轻量模型便优于 FLOPs 多 2–20 倍、使用更大数据集(其中部分近 10 亿训练样本)的若干倍大的最先进模型。
引用
@article{arxiv.2305.19924,
title = {Joint Adaptive Representations for Image-Language Learning},
author = {AJ Piergiovanni and Anelia Angelova},
journal= {arXiv preprint arXiv:2305.19924},
year = {2023}
}
备注
T4V Workshop