全景场景图生成
计算机视觉与模式识别
2022-07-25 v1 人工智能
计算与语言
机器学习
多媒体
摘要
现有研究从检测视角解决场景图生成(SGG)——一项用于图像场景理解的关键技术——即使用边界框检测物体,然后预测其成对关系。我们认为这种范式导致了若干阻碍该领域进展的问题。例如,当前数据集中的基于边界框的标签通常包含如头发等冗余类别,并遗漏了对上下文理解至关重要的背景信息。在这项工作中,我们引入全景场景图生成(PSG),一个新的问题任务,要求模型基于全景分割而非刚性边界框生成更全面的场景图表示。我们为社区创建了一个高质量PSG数据集,包含来自COCO和Visual Genome的49k张标注良好的重叠图像,以追踪其进展。为进行基准测试,我们构建了四个两阶段基线(由SGG中的经典方法修改而来)以及两个称为PSGTR和PSGFormer的单阶段基线,它们基于高效的Transformer-based检测器即DETR。PSGTR使用一组查询直接学习三元组,而PSGFormer以来自两个Transformer解码器的查询形式分别建模物体和关系,随后采用类提示的关系-物体匹配机制。最后,我们分享了关于开放挑战和未来方向的见解。
引用
@article{arxiv.2207.11247,
title = {Panoptic Scene Graph Generation},
author = {Jingkang Yang and Yi Zhe Ang and Zujin Guo and Kaiyang Zhou and Wayne Zhang and Ziwei Liu},
journal= {arXiv preprint arXiv:2207.11247},
year = {2022}
}
备注
Accepted to ECCV'22 (Paper ID #222, Final Score 2222). Project Page: https://psgdataset.org/. OpenPSG Codebase: https://github.com/Jingkang50/OpenPSG