超越分割:基于多模态大语言模型的路网生成
计算机视觉与模式识别
2023-10-19 v1 人工智能
摘要
本文提出一种利用多模态大语言模型(LLM)进行路网生成的创新方法。我们的模型专门设计用于处理道路布局的航拍图像,并在输入图像中生成详细、可导航的路网。我们系统的核心创新在于为令大语言模型生成路网输出所采用的独特训练方法。该方法受 BLIP-2 架构 arXiv:2301.12597 启发,利用预训练冻结的图像编码器与大语言模型来创建通用的多模态 LLM。我们的工作也提供了对 LISA 论文 arXiv:2308.00692 中提出的推理分割方法的替代方案。通过以我们的方法训练大语言模型,LISA 论文 arXiv:2308.00692 中所建议的生成二值分割掩码的必要性被有效消除。实验结果凸显了我们的多模态 LLM 在提供精确且有价值的导航指引方面的效能。本研究代表了在强化自主导航系统(尤其在路网场景中,精确指引至关重要)方面的重要进展。
引用
@article{arxiv.2310.09755,
title = {Beyond Segmentation: Road Network Generation with Multi-Modal LLMs},
author = {Sumedh Rasal and Sanjay Kumar Boddhu},
journal= {arXiv preprint arXiv:2310.09755},
year = {2023}
}