SceneParser:面向视觉语义理解的层次化场景解析
摘要
场景感知从对象识别逐步发展至开放词汇 grounding、部件定位和 affordance 预测。然而,这些能力常以孤立的预测形式实现,对对象、部件或交互点的 localizatoin,却未能捕获交互导向场景理解所需的结构依赖。为此,我们引入层次化场景解析,这是一种以交互为导向的解析任务,将物理场景表示为显式的 scene → object → part → affordance 层次结构,并包含跨层次的绑定。我们以 SceneParser 为例,基于 VLM 的 parser 用于统一的层次化生成,结合结构完成伪标签和 curriculum learning。为支持训练和评估,我们构建了 SceneParser-Bench,一个由可扩展的层次化数据引擎构建的大规模基准数据集,包含 11 万训练图像,5 千验证 split,77 万个对象,114 万个部件,174 万个 affordance 注释,以及 174 万个有效 object-part-affordance 链实例。我们进一步引入 Level-1 至 Level-3 的条件指标和 ParseRate,用于评估 localization、跨层次绑定和层次化完整性。实验表明,现有的 MLLMs 和 perception-stitching 流水线在我们 SceneParser-Bench 上处理层次化解析时表现不佳,而 SceneParser 能实现更强的结构感知性能。此外,ablation 实验、在 COCO 和 AGD20K 上的评估,以及下游 planning probe 结果表明,我们的 SceneParser 与传统任务兼容,并为视觉理解提供可操作的表示。
关键词
引用
@article{arxiv.2605.14923,
title = {SceneParser: Hierarchical Scene Parsing for Visual Semantics Understanding},
author = {Pengxin Xu and Xincheng Lin and Luping Xiao and Qing Jiang and Meishan Zhang and Hao Fei and Shanghang Zhang and Xingyu Chen},
journal= {arXiv preprint arXiv:2605.14923},
year = {2026}
}
备注
Preprint. Code, models, and dataset are provided in the manuscript