全景视频场景图生成
计算机视觉与模式识别
2023-11-29 v1 人工智能
摘要
为构建全面的真实世界视觉感知系统,我们提出并研究了一个称为全景场景图生成(PVSG)的新问题。PVSG与已有的视频场景图生成(VidSGG)问题相关,后者关注视频中由边界框定位的人与物体之间的时序交互。然而,边界框在检测非刚性物体和背景上的局限性常导致VidSGG遗漏对全面视频理解至关重要的关键细节。相比之下,PVSG要求场景图中的节点由更精确的像素级分割掩码定位,从而促进整体场景理解。为推动该新领域的研究,我们贡献了PVSG数据集,包含400段视频(289段第三人称+111段第一人称视频),总计150K帧,标注有全景分割掩码以及精细的时序场景图。我们还提供了多种基线方法并分享了供未来工作参考的实用设计经验。
引用
@article{arxiv.2311.17058,
title = {Panoptic Video Scene Graph Generation},
author = {Jingkang Yang and Wenxuan Peng and Xiangtai Li and Zujin Guo and Liangyu Chen and Bo Li and Zheng Ma and Kaiyang Zhou and Wayne Zhang and Chen Change Loy and Ziwei Liu},
journal= {arXiv preprint arXiv:2311.17058},
year = {2023}
}
备注
Accepted to CVPR 2023. Project Page: https://jingkang50.github.io/PVSG/. Codebase: https://github.com/LilyDaytoy/OpenPVSG. We provide 400 long videos with frame-level panoptic segmentation, scene graph, dense captions, and QA annotations