中文

RelVAE:面向少样本视觉关系检测的生成式预训练

计算机视觉与模式识别 2023-11-29 v1 人工智能

摘要

视觉关系是复杂的多模态概念,在人类感知世界的方式中起着重要作用。由于其复杂性,高质量、多样且大规模视觉关系数据集仍然缺失。为克服这一数据障碍,我们选择关注少样本视觉关系检测(VRD)问题,该设定迄今被学界所忽视。在本工作中,我们提出了首个无需任何标注关系即可进行的少样本谓词分类预训练方法。为此我们引入了一个生成模型,能够在潜空间中捕捉关系的语义、视觉与空间信息的变化,随后利用其表示实现高效的少样本分类。我们构建了少样本训练划分,并在 VG200 与 VRD 数据集上展示了定量实验,我们的模型优于基线。最后,我们通过多种定性实验尝试解释模型的决策。

关键词

引用

@article{arxiv.2311.16261,
  title  = {RelVAE: Generative Pretraining for few-shot Visual Relationship Detection},
  author = {Sotiris Karapiperis and Markos Diomataris and Vassilis Pitsikalis},
  journal= {arXiv preprint arXiv:2311.16261},
  year   = {2023}
}