面向导航应用的鲁棒视觉语言模型-传感器融合的自适应框架——PhysNav-DG
计算机视觉与模式识别
2025-06-16 v3 人工智能
机器学习
多媒体
机器人学
摘要
在多样化环境和域中实现可靠导航既需要精准的状态估计,又需要透明的决策解释。我们提出PhysNav-DG,一种新型框架,将经典传感器融合与视觉语言模型的语义能力相结合。该框架采用双分支架构,从多传感器输入预测导航动作,同时生成详细的链式思考解释。经修改的自适应卡尔曼滤波根据环境背景动态调整噪声参数。它利用多流原始传感器数据,结合LLaMA 3.2 11B和BLIP-2等模型的语义洞察。为评估该方法,我们引入了MD-NEX基准数据集,这是一个新型多域数据集,统一了室内导航、自动驾驶和社交导航任务,包含人类验证的解释。大量实验和消融实验表明,PhysNav-DG在导航成功率上提升了20%以上,实现高效运行,解释既有高度依据又清晰明了。这一工作将高层语义推理与几何规划相连接,为更安全更可信的自主系统提供支持。
引用
@article{arxiv.2505.01881,
title = {PhysNav-DG: A Novel Adaptive Framework for Robust VLM-Sensor Fusion in Navigation Applications},
author = {Trisanth Srinivasan and Santosh Patapati},
journal= {arXiv preprint arXiv:2505.01881},
year = {2025}
}
备注
Accepted at IEEE/CVF Computer Society Conference on Computer Vision and Pattern Recognition Workshops 2025 (CVPRW)