中文

用于视觉关系检测与场景图生成的上下文翻译嵌入

计算机视觉与模式识别 2020-11-19 v3

摘要

实体间的关系在图像理解中起着核心作用。由于建模(主体,谓词,客体)关系三元组的复杂性,开发一种不仅能识别已见关系、还能泛化到未见情况的方法至关重要。受先前提出的视觉翻译嵌入模型(即 VTransE)启发,我们提出一种上下文增强的翻译嵌入模型,可捕获常见与罕见关系。先前的 VTransE 模型将实体与谓词映射到低维嵌入向量空间,其中谓词被解释为主体与客体边界框区域嵌入特征之间的平移向量。我们的模型额外纳入了由主体与客体并集边界框捕获的上下文信息,并在约束谓词 \approx 并集(主体, 客体) - 主体 - 客体 的指导下学习嵌入。在多个具挑战性基准的全面评估中,我们的方法优于先前的基于翻译的模型,并在从小规模到大规模数据集、从常见到先前未见关系的多种设置下接近或超越 state of the art。它也为近期引入的场景图生成任务取得了有前景的结果。

关键词

引用

@article{arxiv.1905.11624,
  title  = {Contextual Translation Embedding for Visual Relationship Detection and Scene Graph Generation},
  author = {Zih-Siou Hung and Arun Mallya and Svetlana Lazebnik},
  journal= {arXiv preprint arXiv:1905.11624},
  year   = {2020}
}