多尺度CLIP特征在3D地图中的在线嵌入
机器人学
2024-03-28 v1 计算机视觉与模式识别
摘要
本研究提出了一种将多尺度CLIP(Contrastive Language-Image Pre-Training)特征嵌入到3D地图中的新方法。通过利用CLIP,该方法超越了传统词汇受限方法的限制,使其能够将语义信息纳入最终地图中。虽然最近的研究探索了将多模态特征嵌入地图,但这些方法往往计算成本高昂,难以在实时中探索陌生环境。我们的做法通过高效计算和嵌入多尺度CLIP特征,从而实现对陌生环境的实时地图生成。此外,将CLIP特征嵌入最终地图后,可实现基于语言查询的离线检索。简而言之,我们的方法同时实现了实时对象搜索和陌生环境的地图构建。我们还提出了基于我们映射方法的零样本目标导航系统,并通过仿真环境和实际机器人实验验证了其有效性。研究结果表明,我们的方法不仅比最先进的映射方法更快,而且在对象目标导航任务的成功率方面也更优。
引用
@article{arxiv.2403.18178,
title = {Online Embedding Multi-Scale CLIP Features into 3D Maps},
author = {Shun Taguchi and Hideki Deguchi},
journal= {arXiv preprint arXiv:2403.18178},
year = {2024}
}
备注
8 pages, 7 figures