基于视觉的室内环境定位与基于大语言模型的导航
机器学习
2025-08-12 v1 人工智能
计算机视觉与模式识别
摘要
室内导航因缺乏可靠GPS信号以及大型封闭环境的建筑结构复杂性而保持较为困难。本研究提出了一种将视觉定位与大语言模型(LLM)导航集成的室内定位和导航方法。该定位系统利用经过两阶段微调的ResNet-50卷积神经网络,通过智能手机摄像头输入来识别用户位置。为补充定位功能,导航模块采用LLM,由精心设计的系统提示符指导,解释预处理后的平面图图像并生成分步导航指令。实验在具有重复特征和受限视野的真实办公走廊中进行,以测试定位鲁棒性。该模型在所有测试 waypoint 上的置信度和准确率均达到96%,即使在受限观察条件和短时程查询下亦如此。使用ChatGPT在真实建筑平面图进行导航测试时,平均指令准确率为75%,并观察到零样推理和推理时间的局限性。该研究表明,利用即插即用的摄像头和公开可用的平面图,在如医院、机场和教育机构等资源受限的环境中实现可扩展且无基础设施依赖的室内导航具有潜在价值。
引用
@article{arxiv.2508.08120,
title = {Vision-Based Localization and LLM-based Navigation for Indoor Environments},
author = {Keyan Rahimi and Md. Wasiul Haque and Sagar Dasgupta and Mizanur Rahman},
journal= {arXiv preprint arXiv:2508.08120},
year = {2025}
}
备注
20 pages, 6 figures, 1 table