GRILL:通过对齐文本与图像区域实现的 grounded 视觉语言预训练
计算与语言
2023-05-25 v1
摘要
对未见任务的泛化能力是少样本学习器在多样任务上取得更好零样本/少样本性能的重要能力。然而,对包括定位与生成任务在内的视觉语言任务的此类泛化尚未得到充分探索;现有少样本视觉语言模型难以处理涉及物体定位与多图像的任务,如视觉常识推理或NLVR2。本文引入GRILL(GRounded vIsion Language aLigning, grounded 视觉语言对齐),一种新颖的视觉语言模型,可在无或极少训练样本的情况下泛化至包括视觉问答、图像描述与定位任务在内的多样任务。具体而言,GRILL通过利用物体-文本对齐来学习物体定位与局部化,使其能以零样本/少样本方式迁移至定位任务。我们在多种零样本/少样本视觉语言任务上评估我们的模型,并表明其持续超越最先进的少样本方法。
引用
@article{arxiv.2305.14676,
title = {GRILL: Grounded Vision-language Pre-training via Aligning Text and Image Regions},
author = {Woojeong Jin and Subhabrata Mukherjee and Yu Cheng and Yelong Shen and Weizhu Chen and Ahmed Hassan Awadallah and Damien Jose and Xiang Ren},
journal= {arXiv preprint arXiv:2305.14676},
year = {2023}
}
备注
Preprint