中文

RelTransformer:一种基于 Transformer 的长尾视觉关系识别方法

计算机视觉与模式识别 2022-03-30 v2 人工智能

摘要

视觉关系识别(VRR)任务旨在理解图像中交互物体之间的成对视觉关系。由于其组合性质,这些关系通常具有长尾分布。当词汇量变大时,该问题变得更加严重,使得此任务极具挑战性。本文表明,通过注意力机制建模有效的消息传递流,对应对 VRR 中的组合性与长尾挑战至关重要。该方法称为 RelTransformer,将每幅图像表示为全连接场景图,并将整个场景重构为关系三元组与全局场景上下文。它经由自注意力将关系三元组与全局场景上下文中各元素的消息直接传递给目标关系。我们还设计了一种可学习记忆以增强长尾关系表示学习。通过大量实验,我们发现模型在许多 VRR 基准上泛化良好。我们的模型在两个大规模长尾 VRR 基准 VG8K-LT(+2.0% 总体准确率)和 GQA-LT(+26.0% 总体准确率)上优于性能最佳的模型,二者均具有高度偏向尾部的分布。它也在 VG200 关系检测任务上取得强劲结果。我们的代码见 https://github.com/Vision-CAIR/RelTransformer。

关键词

引用

@article{arxiv.2104.11934,
  title  = {RelTransformer: A Transformer-Based Long-Tail Visual Relationship Recognition},
  author = {Jun Chen and Aniket Agarwal and Sherif Abdelkarim and Deyao Zhu and Mohamed Elhoseiny},
  journal= {arXiv preprint arXiv:2104.11934},
  year   = {2022}
}