CoNav:用于躲体导航的协作式跨模态推理
计算机视觉与模式识别
2025-05-23 v1 多媒体
摘要
躲体导航需要全面的场景理解和精确的空间推理。虽然图像-文本模型在解释像素级颜色和光照线索方面表现出色,3D-文本模型则捕捉体积结构和空间关系。然而,统一融合方法面临着三模态数据稀缺和难以解决模态间信念冲突的挑战。本文引入CoNav,一种协作式跨模态推理框架,其中预训练的3D-文本模型通过提供结构化的空间语义知识来明确指导图像-文本导航代理,从而在导航期间解决歧义。具体而言,我们引入跨模态信念对齐机制,通过简单地共享3D-文本模型提供的文本假设来实现跨模态指导。在针对小型2D-3D-文本语料库上的轻量级微调后,导航代理学习如何整合视觉线索与来自3D-文本模型的空间语义知识,从而在躲体导航中实现有效推理。CoNav在四个标准躲体导航基准(R2R、CVDN、REVERIE、SOON)和两个空间推理基准(ScanQA、SQA3D)上实现了显著提升。此外,在接近导航成功率方面,CoNav通常会生成更短的路径(如SPL),展示了在躲体导航中融合来自不同模态数据的潜力与挑战。项目页面:https://oceanhao.github.io/CoNav/。
引用
@article{arxiv.2505.16663,
title = {CoNav: Collaborative Cross-Modal Reasoning for Embodied Navigation},
author = {Haihong Hao and Mingfei Han and Changlin Li and Zhihui Li and Xiaojun Chang},
journal= {arXiv preprint arXiv:2505.16663},
year = {2025}
}