中文

Guide-LLM:面向视觉障碍人群机器人引导的具身 LLM 智能体与基于文本的拓扑地图

机器人学 2025-03-13 v2 人工智能 计算与语言

摘要

导航对视觉障碍人群(PVI)构成了重大挑战。虽然白手杖和导盲犬等传统辅助工具非常宝贵,但它们在提供详细的空间信息和精确引导至所需位置方面存在不足。大语言模型(LLMs)和视觉语言模型(VLMs)的最新发展为增强辅助导航提供了新途径。在本文中,我们介绍了 Guide-LLM,这是一种基于具身 LLM 的智能体,旨在帮助 PVI 在大型室内环境中导航。我们的方法采用了一种新颖的基于文本的拓扑地图,使 LLM 能够利用简化的环境表示来规划全局路径,专注于直行路径和直角转弯以促进导航。此外,我们利用 LLM 的常识推理进行危险检测,并根据用户偏好进行个性化路径规划。模拟实验证明了该系统在引导 PVI 方面的有效性,突显了其作为辅助技术重大进步的潜力。结果突出了 Guide-LLM 提供高效、自适应和个性化导航辅助的能力,指明了该领域有前景的发展方向。

关键词

引用

@article{arxiv.2410.20666,
  title  = {Guide-LLM: An Embodied LLM Agent and Text-Based Topological Map for Robotic Guidance of People with Visual Impairments},
  author = {Sangmim Song and Sarath Kodagoda and Amal Gunatilake and Marc G. Carmichael and Karthick Thiyagarajan and Jodi Martin},
  journal= {arXiv preprint arXiv:2410.20666},
  year   = {2025}
}