基于视觉与语言模型的统一视觉关系检测
计算机视觉与模式识别
2023-08-22 v2
摘要
本工作致力于训练一个单一的视觉关系检测器,以预测多个数据集标签空间的并集。由于分类体系不一致,合并跨越不同数据集的标签可能具有挑战性。当在物体对之间引入二阶视觉语义时,这一问题在视觉关系检测中更加严重。为应对该挑战,我们提出 UniVRD,一种利用视觉与语言模型(VLMs)实现统一视觉关系检测的新型自底向上方法。VLMs 提供对齐良好的图像与文本嵌入,其中相似的关系被优化为彼此接近以实现语义统一。我们的自底向上设计使模型能够受益于同时使用物体检测与视觉关系数据集进行训练。在人体-物体交互检测与场景图生成上的实证结果表明了模型的竞争性性能。UniVRD 在 HICO-DET 上取得 38.07 mAP,比当前最佳自底向上 HOI 检测器高出 14.26 mAP。更重要的是,我们表明我们的统一检测器在 mAP 上表现与特定数据集的模型相当,并在扩大模型规模时取得进一步提升。我们的代码将在 GitHub 上公开。
引用
@article{arxiv.2303.08998,
title = {Unified Visual Relationship Detection with Vision and Language Models},
author = {Long Zhao and Liangzhe Yuan and Boqing Gong and Yin Cui and Florian Schroff and Ming-Hsuan Yang and Hartwig Adam and Ting Liu},
journal= {arXiv preprint arXiv:2303.08998},
year = {2023}
}
备注
Accepted to ICCV 2023. Code is available at https://github.com/google-research/scenic/tree/main/scenic/projects/univrd