GeoDecoder:赋能多模态地图理解
计算机视觉与模式识别
2024-02-20 v2 人工智能
摘要
本文提出 GeoDecoder,一个专为处理地图中地理空间信息而设计的专用多模态模型。GeoDecoder 基于 BeitGPT 架构构建,集成了专门的图像与文本处理专家模块。在图像侧,GeoDecoder 采用高德地图作为底图,该底图天然包含道路与建筑形状、相对位置及其他属性的关键细节。通过利用渲染技术,该模型无缝整合了符号标记、行车轨迹、热力图及用户自定义标记等外部数据与特征,无需额外的特征工程。GeoDecoder 的文本模块接收各类上下文文本与问题提示,生成 GPT 风格的文本输出。此外,基于 GPT 的模型允许在同一模型内以端到端方式训练和执行多项任务。为增强地图认知并使 GeoDecoder 能够获取北京地理实体分布的知识,我们设计了八项基础地理空间任务,并利用大规模图文样本对模型进行预训练。随后,在三个下游任务上进行快速微调,取得了显著的性能提升。GeoDecoder 模型展现了对地图元素及其相关操作的全面理解,能够在不同业务场景中高效、高质量地应用多样化的地理空间任务。
引用
@article{arxiv.2401.15118,
title = {GeoDecoder: Empowering Multimodal Map Understanding},
author = {Feng Qi and Mian Dai and Zixian Zheng and Chao Wang},
journal= {arXiv preprint arXiv:2401.15118},
year = {2024}
}