中文

场景感知的城市设计:基于共现嵌入和视觉语言模型的人类-AI 推荐框架

计算机视觉与模式识别 2025-11-11 v1 人机交互

摘要

本文引入一个以人类为中心的计算机视觉框架,使用生成式AI提出公共空间中的微观级设计干预,并支持更持续、本地化的参与。使用Grounding DINO和ADE20K数据集的精选子集作为城市建筑环境的代理,系统检测城市对象并构建共现嵌入,以揭示常见的空间配置。从该分析中,用户接收五个来自选定锚定对象的统计性可能补充物。视觉语言模型随后对场景图像和选定的配对进行推理,以建议完成更复杂城市战术的第三个对象。该工作流程保持人类的选择和细化控制,旨在超越自上而下的总体规划,通过将选择 grounded在日常模式和 lived 经验上。

关键词

引用

@article{arxiv.2511.06201,
  title  = {Scene-Aware Urban Design: A Human-AI Recommendation Framework Using Co-Occurrence Embeddings and Vision-Language Models},
  author = {Rodrigo Gallardo and Oz Fishman and Alexander Htet Kyaw},
  journal= {arXiv preprint arXiv:2511.06201},
  year   = {2025}
}

备注

Accepted to NEURIPS 2025 Creative AI Track