面向场景图生成的视觉远程监督
计算机视觉与模式识别
2021-08-23 v2
摘要
场景图生成旨在识别图像中的物体及其关系,提供结构化的图像表示,可助力计算机视觉中的众多应用。然而,场景图模型通常需要在大量带密集人工标注的标记数据上进行监督学习。在本工作中,我们提出视觉远程监督——一种新颖的视觉关系学习范式,可在无任何人工标注数据的情况下训练场景图模型。其直觉在于,通过对齐常识知识库与图像,我们可以自动创建大规模标记数据,为视觉关系学习提供远程监督。为减轻远程标注数据中的噪声,我们进一步提出一个框架,迭代地估计概率关系标签并剔除噪声标签。综合实验结果表明,我们的远程监督模型优于强弱监督与半监督基线。通过以半监督方式进一步融入人工标注数据,我们的模型大幅优于最先进的完全监督模型(例如,在 Visual Genome 评估中,谓词分类的微平均与宏平均 recall@50 分别提升 8.3 与 7.8)。我们将本文的数据与代码公开于 https://github.com/thunlp/VisualDS。
引用
@article{arxiv.2103.15365,
title = {Visual Distant Supervision for Scene Graph Generation},
author = {Yuan Yao and Ao Zhang and Xu Han and Mengdi Li and Cornelius Weber and Zhiyuan Liu and Stefan Wermter and Maosong Sun},
journal= {arXiv preprint arXiv:2103.15365},
year = {2021}
}
备注
Accepted by ICCV 2021