中文

全景场景图生成

计算机视觉与模式识别 2022-07-25 v1 人工智能 计算与语言 机器学习 多媒体

摘要

现有研究从检测视角解决场景图生成(SGG)——一项用于图像场景理解的关键技术——即使用边界框检测物体,然后预测其成对关系。我们认为这种范式导致了若干阻碍该领域进展的问题。例如,当前数据集中的基于边界框的标签通常包含如头发等冗余类别,并遗漏了对上下文理解至关重要的背景信息。在这项工作中,我们引入全景场景图生成(PSG),一个新的问题任务,要求模型基于全景分割而非刚性边界框生成更全面的场景图表示。我们为社区创建了一个高质量PSG数据集,包含来自COCO和Visual Genome的49k张标注良好的重叠图像,以追踪其进展。为进行基准测试,我们构建了四个两阶段基线(由SGG中的经典方法修改而来)以及两个称为PSGTR和PSGFormer的单阶段基线,它们基于高效的Transformer-based检测器即DETR。PSGTR使用一组查询直接学习三元组,而PSGFormer以来自两个Transformer解码器的查询形式分别建模物体和关系,随后采用类提示的关系-物体匹配机制。最后,我们分享了关于开放挑战和未来方向的见解。

关键词

引用

@article{arxiv.2207.11247,
  title  = {Panoptic Scene Graph Generation},
  author = {Jingkang Yang and Yi Zhe Ang and Zujin Guo and Kaiyang Zhou and Wayne Zhang and Ziwei Liu},
  journal= {arXiv preprint arXiv:2207.11247},
  year   = {2022}
}

备注

Accepted to ECCV'22 (Paper ID #222, Final Score 2222). Project Page: https://psgdataset.org/. OpenPSG Codebase: https://github.com/Jingkang50/OpenPSG