中文

用于视觉关系检测的视觉平移嵌入网络

计算机视觉与模式识别 2017-02-28 v1

摘要

视觉关系,如“人骑自行车”和“自行车在汽车旁边”,提供了对图像全面的场景理解,并已显示出其在连接计算机视觉与自然语言方面的巨大效用。然而,由于对主体-谓词-客体关系三元组进行建模的组合复杂性极具挑战性,在定位和预测视觉关系方面所做的工作很少。受知识库关系表示学习和卷积目标检测网络最新进展的启发,我们提出了一种用于视觉关系检测的视觉平移嵌入网络(VTransE)。VTransE 将物体置于一个低维关系空间中,在该空间中,关系可以被建模为简单的向量平移,即 主体 + 谓词 \approx 客体。我们提出了一种新颖的特征提取层,该层以全卷积方式实现物体-关系知识迁移,支持在单次前向/后向传递中进行训练和推理。据我们所知,VTransE 是第一个端到端的关系检测网络。我们在两个大规模数据集:Visual Relationship 和 Visual Genome 上展示了 VTransE 相对于其他最先进方法的有效性。请注意,尽管 VTransE 是一个纯视觉模型,但它仍然能与 Lu 的带有语言先验的多模态模型相竞争。

关键词

引用

@article{arxiv.1702.08319,
  title  = {Visual Translation Embedding Network for Visual Relation Detection},
  author = {Hanwang Zhang and Zawlin Kyaw and Shih-Fu Chang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:1702.08319},
  year   = {2017}
}