中文

TextPSG:从文本描述生成全景场景图

计算机视觉与模式识别 2025-04-11 v2

摘要

全景场景图近来被提出用于全面场景理解。然而,先前工作采用全监督学习方式,需要大量像素级密集标注数据,这类数据获取往往繁琐且昂贵。为应对此局限,我们研究一个新问题:从纯文本描述生成全景场景图(Caption-to-PSG)。其核心思想是仅利用网络上大量的免费图像-描述数据来生成全景场景图。该问题因三项约束而极具挑战:1)无位置先验;2)视觉区域与文本实体间无显式关联;3)无预定义概念集。为此,我们提出新框架 TextPSG,包含四个模块,即区域分组器、实体定位器、片段合并器与标签生成器,并采用若干新技术。区域分组器首先将图像像素分组为不同片段,随后实体定位器基于被指代片段的文本描述将视觉片段与语言实体对齐。该定位结果可作为伪标签,使片段合并器学习片段相似性,并引导标签生成器学习对象语义与关系谓词,从而实现细粒度结构化场景理解。我们的框架有效,显著优于基线并具备强分布外鲁棒性。我们进行了全面消融实验以印证设计选择的有效性,并深入分析以指明未来方向。我们的代码、数据与结果发布于项目页:https://textpsg.github.io/。

关键词

引用

@article{arxiv.2310.07056,
  title  = {TextPSG: Panoptic Scene Graph Generation from Textual Descriptions},
  author = {Chengyang Zhao and Yikang Shen and Zhenfang Chen and Mingyu Ding and Chuang Gan},
  journal= {arXiv preprint arXiv:2310.07056},
  year   = {2025}
}

备注

Accepted by ICCV 2023