中文

SrTR:面向场景图生成的具有视觉-语言知识的自推理 Transformer

计算机视觉与模式识别 2022-12-20 v1

摘要

场景中的物体并非总是相关的。单阶段场景图生成方法的执行效率相当高,它们使用稀疏提议集和少量查询来推断实体对之间的有效关系。然而,它们只关注三元组集合(主体实体、谓词实体、客体实体)中主体与客体之间的关系,忽略了主体与谓词或谓词与客体之间的关系,且模型缺乏自推理能力。此外,单阶段方法中语言模态被忽视了。挖掘语言模态知识以提升模型推理能力是必要的。为解决上述不足,提出了一种具有视觉-语言知识的自推理 Transformer (SrTR),为模型增加灵活的自推理能力。SrTR 采用编码器-解码器架构,并开发了一个自推理解码器来完成三元组集合的三种推理:s+o→p、s+p→o 和 p+o→s。受大规模预训练图像-文本基础模型启发,引入了视觉-语言先验知识,并设计了一种视觉-语言对齐策略,将视觉表示投影到具有先验知识的语义空间中,以辅助关系推理。在 Visual Genome 数据集上的实验证明了所提方法的优越性和快速推理能力。

关键词

引用

@article{arxiv.2212.09329,
  title  = {SrTR: Self-reasoning Transformer with Visual-linguistic Knowledge for Scene Graph Generation},
  author = {Yuxiang Zhang and Zhenbo Liu and Shuai Wang},
  journal= {arXiv preprint arXiv:2212.09329},
  year   = {2022}
}