中文

一种可解释的场景图生成模型

计算机视觉与模式识别 2018-11-26 v1

摘要

我们提出了一种高效且可解释的场景图生成器。我们考虑三类特征:视觉、空间和语义特征,并采用后期融合策略,使得每种特征的贡献都能被显式地研究。我们研究了这些特征中对性能影响最大的关键因素,并可视化了学习到的关系视觉特征,探究了模型的有效性。我们在 Kaggle 的 OpenImages 视觉关系检测挑战赛中获得冠军,相对第二名高出 5%(相对提升 20%)。我们相信准确的场景图生成器是图像描述与视觉问答等更高层视觉-语言任务的基础基石,因为它提供了超越像素与物体的对图像的语义化、结构化理解。

关键词

引用

@article{arxiv.1811.09543,
  title  = {An Interpretable Model for Scene Graph Generation},
  author = {Ji Zhang and Kevin Shih and Andrew Tao and Bryan Catanzaro and Ahmed Elgammal},
  journal= {arXiv preprint arXiv:1811.09543},
  year   = {2018}
}

备注

arXiv admin note: substantial text overlap with arXiv:1811.00662