基于多模态大语言模型的多智能体制图框架:用于地图风格迁移与评估的 CartoAgent
人机交互
2025-05-16 v1 图形学
多智能体系统
多媒体
摘要
生成式人工智能(GenAI)的快速发展为推进制图过程提供了新的机会。以往研究要么忽视了地图的艺术方面,要么在创建准确且信息丰富的地图方面面临挑战。本研究提出了 CartoAgent,一个由多模态大语言模型(MLLM)驱动的新型多智能体制图框架。该框架模拟了制图实践中的三个关键阶段:准备、设计和评估。在每个阶段,不同的 MLLM 充当具有不同角色的智能体,协作、讨论并利用特定工具以完成特定目的。在具体方面,CartoAgent 利用 MLLM 的视觉审美能力和世界知识生成既美观又富有信息性的地图。通过将风格与地理数据分离,它可以专注于设计样式而无需修改基于矢量的数据,从而确保地理准确性。我们将 CartoAgent 应用于以地图重新设计为中心的具体任务——即地图风格迁移和评估。通过大量实验和人类评估研究验证了该框架的有效性。CartoAgent 可扩展以支持各种制图设计决策,并为未来 GenAI 在制图界面的集成提供信息。
关键词
引用
@article{arxiv.2505.09936,
title = {CartoAgent: a multimodal large language model-powered multi-agent cartographic framework for map style transfer and evaluation},
author = {Chenglong Wang and Yuhao Kang and Zhaoya Gong and Pengjun Zhao and Yu Feng and Wenjia Zhang and Ge Li},
journal= {arXiv preprint arXiv:2505.09936},
year = {2025}
}
备注
57 pages, 17 figures