面向多样场景的开放词汇对象导航:DivScene 数据集
计算机视觉与模式识别
2025-09-03 v3 计算与语言
机器人学
摘要
大型视觉语言模型(LVLMs)在视觉问答和文档理解等任务中取得了显著进展。然而,其在理解具身环境并在其中导航方面的潜力尚未得到充分探索。本文首先引入 DivScene 数据集,以解决开放词汇对象导航的挑战。DivScene 包含 4614 栋房子,涵盖 81 种场景类型和 5707 种目标对象。该数据集提供了远超现有数据集的目标对象和场景类型的多样性,实现了全面的任务评估。我们在数据集上评估了 various方法结合 LVLMs 和 LLMs,发现当前模型在开放词汇对象导航方面仍不足。随后,我们对 LVLMs 进行微调,以预测带有思考链(CoT)解释的下一个动作。我们观察到,仅通过无人监督的 BFS 生成的最短路径即可显著提升 LVLM 的导航能力,在成功率上超过 GPT-4o 超过 20%。
引用
@article{arxiv.2410.02730,
title = {DivScene: Towards Open-Vocabulary Object Navigation with Large Vision Language Models in Diverse Scenes},
author = {Zhaowei Wang and Hongming Zhang and Tianqing Fang and Ye Tian and Yue Yang and Kaixin Ma and Xiaoman Pan and Yangqiu Song and Dong Yu},
journal= {arXiv preprint arXiv:2410.02730},
year = {2025}
}
备注
EMNLP 2025