从自然语言监督中学习生成场景图
计算机视觉与模式识别
2021-09-07 v1
摘要
从图像-文本数据学习已在诸多识别任务中展现出近期成功,但目前仍局限于视觉特征或对象等独立视觉概念。本文中,我们提出首批从图像-句子对中学习提取图像中定位对象及其关系的图形化表示(即场景图)的方法之一。为弥合图像与文本间的鸿沟,我们利用现成目标检测器识别并定位对象实例,将检测区域标签与从描述中解析出的概念相匹配,从而创建用于场景图学习的“伪”标签。进一步,我们设计一种基于Transformer的模型,通过掩码词元预测任务预测这些“伪”标签。仅从图像-句子对学习,我们的模型相较最新采用人工标注未定位场景图训练的方法取得30%的相对提升。我们的模型在弱监督与全监督场景图生成中亦展现强劲结果。此外,我们探索了场景图检测的开放词汇设定,并给出开放集场景图生成的首次结果。我们的代码发布于https://github.com/YiwuZhong/SGG_from_NLS。
引用
@article{arxiv.2109.02227,
title = {Learning to Generate Scene Graph from Natural Language Supervision},
author = {Yiwu Zhong and Jing Shi and Jianwei Yang and Chenliang Xu and Yin Li},
journal= {arXiv preprint arXiv:2109.02227},
year = {2021}
}
备注
Accepted to ICCV 2021