中文

从像素到谓词:以场景图构建城市感知

计算机视觉与模式识别 2025-12-23 v1 人工智能

摘要

感知研究正日益采用街景图像进行建模,但许多方法仍依赖像素特征或对象共现统计,忽视了塑造人类感知的显式关系。本研究提出三阶段管道,将街景图像 (SVI) 转换为结构化表示,用于预测六个感知指标。第一阶段,使用开放式全景场景图模型 (OpenPSG) 对每张图像进行解析,以提取对象-谓词-对象三元组。第二阶段,通过异构图自编码器 (GraphMAE) 学习场景级别的紧凑嵌入。第三阶段,神经网络基于这些嵌入预测感知得分。我们在准确性、精度和跨城市泛化方面,将所提方法与仅图像的基线模型进行评估。结果表明:(i) 所提方法在感知预测准确率上平均提高 26%;(ii) 在跨城市预测任务中保持强大的泛化性能。此外,结构化表示阐明了哪些关系模式导致城市场景中感知得分较低,例如墙面涂鸦和停在人行道上的汽车。总体而言,本研究表明图基结构为建模城市感知提供了表达力强、可泛化且可解释的信号,推动了以人为本且具情境感知能力的城市分析。

关键词

引用

@article{arxiv.2512.19221,
  title  = {From Pixels to Predicates Structuring urban perception with scene graphs},
  author = {Yunlong Liu and Shuyang Li and Pengyuan Liu and Yu Zhang and Rudi Stouffs},
  journal= {arXiv preprint arXiv:2512.19221},
  year   = {2025}
}

备注

10 pages, CAADRIA2026 presentation forthcoming