通过生成式通信改进零样本目标导航
机器人学
2024-10-03 v3 计算机视觉与模式识别
摘要
我们提出了一种新方法,用于改进零样本ObjectNav,旨在利用可用的环境感知信息提供导航辅助。我们的做法考虑到,地面代理可能具有有限且有时被遮挡的视野。我们的表述鼓励在具备全局视野并包含目标对象的辅助性 overhead 代理与具备被遮挡视野的地面代理之间进行生成式通信(GC);两者都配备有视觉语言模型(VLM)进行视觉到语言翻译。在这种辅助设置下,具身代理在地面代理执行前进目标的动作之前与之通信以传递环境信息。尽管 overhead 代理拥有包含目标的全局视野,但我们注意到在完全合作的辅助方案相对于未受辅助的基线时,表现下降(OSR下降13%,SPL下降13%)。相比之下,一种选择性辅助方案,即地面代理保留其独立探索行为的方案,显示出10%的OSR提升和7.65%的SPL提升。为解释导航性能,我们分析了GC的独特特征,量化了幻觉和合作的存在。具体我们识别出在具身环境中出现的一种新型语言特征,即预emptive幻觉,其中 overhead 代理在对话中假设地面代理已执行动作,但实际上尚未移动,我们注意到这与导航性能强相关。我们进行了实际实验并呈现了一些定性示例,通过微调提示来缓解幻觉,从而提高ObjectNav性能。
引用
@article{arxiv.2408.01877,
title = {Improving Zero-Shot ObjectNav with Generative Communication},
author = {Vishnu Sashank Dorbala and Vishnu Dutt Sharma and Pratap Tokekar and Dinesh Manocha},
journal= {arXiv preprint arXiv:2408.01877},
year = {2024}
}