VReBERT:一种用于视觉关系检测的简单灵活 Transformer
计算机视觉与模式识别
2022-06-22 v1 人工智能
摘要
视觉关系检测 (VRD) 促使计算机视觉模型“看见”单个对象实例之外的内容,并“理解”场景中不同对象之间的关联方式。传统的 VRD 方法是首先检测图像中的对象,然后分别预测检测到的对象实例之间的关系。这种分离式方法容易为同一对象对预测出语义相似但冗余的关系标签(即谓词),或预测出与真实标签含义相似但语义上不正确的错误标签。为解决此问题,我们提出联合训练一个结合视觉对象特征和语义关系特征的 VRD 模型。为此,我们提出了 VReBERT,一个类似 BERT 的 Transformer 模型,用于视觉关系检测,并采用多阶段训练策略来联合处理视觉和语义特征。我们证明,我们简单的类 BERT 模型在谓词预测方面能够超越最先进的 VRD 模型。此外,我们证明,通过使用预训练的 VReBERT 模型,我们的方法将最先进的零样本谓词预测性能大幅提升(+8.49 R@50 和 +8.99 R@100)。
引用
@article{arxiv.2206.09111,
title = {VReBERT: A Simple and Flexible Transformer for Visual Relationship Detection},
author = {Yu Cui and Moshiur Farazi},
journal= {arXiv preprint arXiv:2206.09111},
year = {2022}
}
备注
Published at International Conference on Pattern Recognition (ICPR) 2022, Montreal Quebec