中文

RLIPv2:关系语言-图像预训练的快速扩展

计算机视觉与模式识别 2023-08-21 v1 人工智能 机器学习 多媒体

摘要

关系语言-图像预训练(RLIP)旨在将视觉表征与关系文本对齐,从而提升计算机视觉任务中关系推理的能力。然而,受限于 RLIPv1 架构的缓慢收敛以及现有场景图数据的有限规模,扩展 RLIPv1 颇具挑战。本文中,我们提出 RLIPv2,一种快速收敛的模型,可将关系预训练扩展至大规模伪标记场景图数据。为实现快速扩展,RLIPv2 引入非对称语言-图像融合(ALIF),一种借助稀疏化语言编码层实现更早且更深门控跨模态融合的机制。ALIF 在预训练与微调的一小部分时间内即可取得与 RLIPv1 相当或更优的性能。为大规模获取场景图数据,我们通过引入描述器(如 BLIP)与所设计的 Relation Tagger,以自由形式关系标签扩展目标检测数据集。Relation Tagger 将 BLIP 生成的关系文本分配给区域对,从而实现更大规模的关系预训练。通过在人机交互检测(Human-Object Interaction Detection)与场景图生成(Scene Graph Generation)上的广泛实验,RLIPv2 在全微调、少样本与零样本设定下的三个基准上均展现出最先进的性能。值得注意的是,最大的 RLIPv2 在 HICO-DET 上无需任何微调即取得 23.29mAP,仅用 1% 数据取得 32.22mAP,用 100% 数据取得 45.09mAP。代码与模型公开于 https://github.com/JacobYuan7/RLIPv2。

关键词

引用

@article{arxiv.2308.09351,
  title  = {RLIPv2: Fast Scaling of Relational Language-Image Pre-training},
  author = {Hangjie Yuan and Shiwei Zhang and Xiang Wang and Samuel Albanie and Yining Pan and Tao Feng and Jianwen Jiang and Dong Ni and Yingya Zhang and Deli Zhao},
  journal= {arXiv preprint arXiv:2308.09351},
  year   = {2023}
}

备注

Accepted to ICCV 2023. Code and models: https://github.com/JacobYuan7/RLIPv2