中文

面向导航应用的鲁棒视觉语言模型-传感器融合的自适应框架——PhysNav-DG

计算机视觉与模式识别 2025-06-16 v3 人工智能 机器学习 多媒体 机器人学

摘要

在多样化环境和域中实现可靠导航既需要精准的状态估计,又需要透明的决策解释。我们提出PhysNav-DG,一种新型框架,将经典传感器融合与视觉语言模型的语义能力相结合。该框架采用双分支架构,从多传感器输入预测导航动作,同时生成详细的链式思考解释。经修改的自适应卡尔曼滤波根据环境背景动态调整噪声参数。它利用多流原始传感器数据,结合LLaMA 3.2 11B和BLIP-2等模型的语义洞察。为评估该方法,我们引入了MD-NEX基准数据集,这是一个新型多域数据集,统一了室内导航、自动驾驶和社交导航任务,包含人类验证的解释。大量实验和消融实验表明,PhysNav-DG在导航成功率上提升了20%以上,实现高效运行,解释既有高度依据又清晰明了。这一工作将高层语义推理与几何规划相连接,为更安全更可信的自主系统提供支持。

关键词

引用

@article{arxiv.2505.01881,
  title  = {PhysNav-DG: A Novel Adaptive Framework for Robust VLM-Sensor Fusion in Navigation Applications},
  author = {Trisanth Srinivasan and Santosh Patapati},
  journal= {arXiv preprint arXiv:2505.01881},
  year   = {2025}
}

备注

Accepted at IEEE/CVF Computer Society Conference on Computer Vision and Pattern Recognition Workshops 2025 (CVPRW)