VIVO:面向新颖物体描述生成的视觉词汇预训练
计算机视觉与模式识别
2021-03-08 v2 计算与语言
机器学习
摘要
生成能够描述在带描述标注的训练数据中未见过的崭新物体的图像描述是非常可取但极具挑战性的,这一能力在新颖物体描述生成挑战赛(nocaps)中得到评测。在该挑战赛中,除 COCO Captions 外,不允许使用额外的图像-描述训练数据用于模型训练。因此,传统的视觉-语言预训练(VLP)方法无法应用。本文提出视觉词汇预训练(VIVO),其在缺乏描述标注的情况下进行预训练。通过打破 VLP 中对成对图像-描述训练数据的依赖,VIVO 可利用大量成对图像-标签数据学习视觉词汇。这是通过预训练一个多层 Transformer 模型来实现的,该模型学习将图像级标签与其对应的图像区域特征对齐。为解决图像标签无序性的问题,VIVO 使用匈牙利匹配损失与掩码标签预测进行预训练。我们通过微调预训练模型用于图像描述生成来验证 VIVO 的有效性。此外,我们对模型推断出的视觉-文本对齐进行了分析。结果表明,我们的模型不仅能生成描述新颖物体的流畅图像描述,还能识别这些物体的位置。我们的单一模型在 nocaps 上取得了新的最先进(SOTA)结果,并超越了人类 CIDEr 分数。
引用
@article{arxiv.2009.13682,
title = {VIVO: Visual Vocabulary Pre-Training for Novel Object Captioning},
author = {Xiaowei Hu and Xi Yin and Kevin Lin and Lijuan Wang and Lei Zhang and Jianfeng Gao and Zicheng Liu},
journal= {arXiv preprint arXiv:2009.13682},
year = {2021}
}
备注
AAAI 2021