中文

面向灵活视觉关系分割

计算机视觉与模式识别 2024-08-16 v1

摘要

视觉关系理解分别在人体-物体互动 (HOI) 检测、场景图生成 (SGG) 和指称关系 (RR) 任务中进行。鉴于这些任务的复杂性和相互关联性,拥有一种灵活的框架以有机方式有效解决这些任务至关重要。在本工作中,我们提出 FleVRS,一个单一模型无缝集成上述三个方面于标准和可提示的视觉关系分割,并进一步具备适应新情景的开放词汇分割能力。FleVRS 利用文本与图像模态之间的协同作用,从图像中对各种类型的关系进行 grounding,并使用来自视觉语言模型的文本特征进行视觉概念理解。跨各种数据集的实证验证表明,我们的框架在标准、可提示和开放词汇任务中均优于现有模型,例如在 HICO-DET 上提升 1.9 mAPmAP,在 VRD 上提升 11.4 AccAcc,在未见 HICO-DET 上提升 4.7 mAPmAP。我们的 FleVRS 表示了对视觉关系进行更直观、全面和可扩展理解的重要一步。

关键词

引用

@article{arxiv.2408.08305,
  title  = {Towards Flexible Visual Relationship Segmentation},
  author = {Fangrui Zhu and Jianwei Yang and Huaizu Jiang},
  journal= {arXiv preprint arXiv:2408.08305},
  year   = {2024}
}