面向导航的可解释且场景感知的学习式调参:基于 MLLM 推理与 CVAE 适配
机器人学
2025-07-16 v1 计算机视觉与模式识别
摘要
服务机器人日益部署在多样化且动态的环境中,其中物理布局和社交语境随时间和地点而变化。在这些非结构化环境中,依赖固定参数的常规导航系统往往难以跨场景泛化,导致性能下降和社会接受度降低。尽管近期方法利用强化学习来增强传统规划器,但这些方法常因泛化性差和仿真多样性有限,在实际部署中难以实现有效的仿真到现实的迁移。为此,我们提出 LE-Nav,一个可解释且场景感知的导航框架,利用多模态大语言模型推理和条件变分自编码器来自适应调谐规划器的超参数。为实现零-shot 场景理解,我们利用一次性示例和链式思维提示策略。此外,条件变分自编码器捕获自然语言指令与导航超参数之间的映射,实现专家水平的调谐。实验表明,LE-Nav 能生成在多样化规划器和场景中达到人类水平调谋效果的超参数。在智能轮椅平台上的实际导航试验和用户研究表明,该方法在成功率、效率、安全性和舒适度等定量指标上优于最先进的方法,同时在感知安全性和社会接受度等主观评分上获得更高的得分。代码可在 https://github.com/Cavendish518/LE-Nav 获取。
引用
@article{arxiv.2507.11001,
title = {Learning to Tune Like an Expert: Interpretable and Scene-Aware Navigation via MLLM Reasoning and CVAE-Based Adaptation},
author = {Yanbo Wang and Zipeng Fang and Lei Zhao and Weidong Chen},
journal= {arXiv preprint arXiv:2507.11001},
year = {2025}
}