中文

StreetviewLLM:基于链式思考多模态大型语言模型的地理信息提取

计算与语言 2024-11-25 v1 人工智能 计算机视觉与模式识别

摘要

地理预测在灾害管理、城市规划和公共卫生等多个领域至为重要。传统机器学习方法在处理非结构化或多模态数据(如街景图像)时常常受限。为此,我们提出了StreetViewLLM框架,集成大型语言模型,采用链式思考推理与多模态数据相结合。通过将街景图像与地理坐标和文本数据相结合,StreetViewLLM提高了地理信息提取的精度和细粒度水平。运用检索增强生成技术,我们的方法增强了地理信息提取,使其能够对城市环境进行深入分析。该模型已应用于七个全球城市,包括香港、东京、新加坡、洛杉矶、纽约、伦敦和巴黎,显示出在预测城市指标(包括人口密度、医疗可达性、归一化植被指数、建筑高度和不透明表面积)方面性能卓越。结果表明,StreetViewLLM在预测城市指标方面持续优于基线模型,提供更高的预测准确率并深化了对城市环境的理解。本研究为将大型语言模型集成到城市分析、城市规划决策、基础设施管理和环境监测中创造了新的机遇。

关键词

引用

@article{arxiv.2411.14476,
  title  = {StreetviewLLM: Extracting Geographic Information Using a Chain-of-Thought Multimodal Large Language Model},
  author = {Zongrong Li and Junhao Xu and Siqin Wang and Yifan Wu and Haiyang Li},
  journal= {arXiv preprint arXiv:2411.14476},
  year   = {2024}
}