WalkCLIP:用于城市步行性预测的多模态学习
计算机视觉与模式识别
2025-12-01 v1 人工智能
机器学习
摘要
城市步行性是公共健康、可持续性和生活质量的基石。传统的步行性评估依赖于调查和现场审计,这些方法成本高昂且难以规模化。最近的研究使用卫星影像、街景影像或人口指标来估计步行性,但这些单一来源的方法仅捕获步行环境的一个维度。卫星数据从上方描述建设环境,却忽视了行人视角。街景影像在地面层面捕获条件,但缺乏更广泛的空间上下文。人口动态揭示了人类活动模式,但不显示环境的视觉形态。我们提出了 WalkCLIP,一个多模态框架,整合了这些互补视角来预测城市步行性。WalkCLIP 从 GPT-4o 生成的图像标题中学习步行性感知的视觉-语言表示,随后通过融合社区语境的空间聚合模块来细化这些表示,并将所得特征与来自人口动态基础模型的表示融合。我们在明尼阿波利斯-圣保罗的 4660 个位置进行评估,WalkCLIP 在预测准确性和空间对齐方面均优于单模态和多模态基线。这些结果表明,视觉信号与行为信号的整合可靠地预测了步行环境。
引用
@article{arxiv.2511.21947,
title = {WalkCLIP: Multimodal Learning for Urban Walkability Prediction},
author = {Shilong Xiang and JangHyeon Lee and Min Namgung and Yao-Yi Chiang},
journal= {arXiv preprint arXiv:2511.21947},
year = {2025}
}