基于上下文与属性支撑的密集描述生成
计算机视觉与模式识别
2019-04-03 v1
摘要
密集描述旨在同时定位语义区域并用自然语言中的短短语或句子描述这些感兴趣区域(ROIs)。以往研究取得了显著进展,但它们常受限于孔径问题,即由某一ROI内部特征生成的描述缺乏与输入图像中周围上下文的连贯性。本文研究了基于从邻近内容到目标ROI的多尺度信息传播的上下文推理。为此,我们设计了一种新颖的端到端上下文与属性支撑的密集描述框架,包含1)上下文视觉挖掘模块和2)多级属性支撑的描述生成模块。考虑到描述常与语言属性(如谁、什么、哪里)共现,我们还引入了来自层级语言属性的辅助监督,以增强所学描述的区分度。在Visual Genome数据集上的大量实验与消融研究证明了所提模型相较于SOTA方法的优越性。
引用
@article{arxiv.1904.01410,
title = {Context and Attribute Grounded Dense Captioning},
author = {Guojun Yin and Lu Sheng and Bin Liu and Nenghai Yu and Xiaogang Wang and Jing Shao},
journal= {arXiv preprint arXiv:1904.01410},
year = {2019}
}
备注
12 pages, 9 figures, accepted as a POSTER at CVPR2019