中文

VrR-VG:聚焦视觉相关关系

计算机视觉与模式识别 2019-08-27 v2

摘要

关系编码了个体实例之间的交互,并在深度视觉场景理解中起着关键作用。由于非视觉信息带来的高可预测性,现有方法倾向于拟合统计偏差,而非从图像中“学习”去“推断”关系。为推动视觉关系研究的进一步发展,我们提出了一种新方法,通过剪枝视觉无关关系来自动挖掘更有价值的关系。我们基于 Visual Genome 构建了一个名为视觉相关关系数据集(Visually-Relevant Relationships Dataset,VrR-VG)的新场景图数据集。与现有数据集相比,在 VrR-VG 中可学习方法与统计方法之间的性能差距更为显著,且基于频率的分析不再有效。此外,我们提出通过联合考虑实例、属性与关系来学习关系感知表示。通过将基于 VrR-VG 学习到的表示感知特征应用于图像描述(image captioning)与视觉问答(visual question answering),其性能均获得大幅系统性提升,这证明了我们的数据集及特征嵌入方案带来的增益。VrR-VG 可通过 http://vrr-vg.com/ 获取。

关键词

引用

@article{arxiv.1902.00313,
  title  = {VrR-VG: Refocusing Visually-Relevant Relationships},
  author = {Yuanzhi Liang and Yalong Bai and Wei Zhang and Xueming Qian and Li Zhu and Tao Mei},
  journal= {arXiv preprint arXiv:1902.00313},
  year   = {2019}
}

备注

Accepted by ICCV2019