中文

SD-OVON:面向动态场景下开放词汇目标导航的语义感知数据集与基准生成管道

计算机视觉与模式识别 2025-05-27 v1 人工智能 机器人学

摘要

我们提出了面向动态场景下开放词汇目标导航的语义感知数据集与基准生成管道(SD-OVON)。该管道利用预训练的多模态基础模型生成无限数量的符合真实世界语义和日常常识的照片写实场景变体,用于训练和评估导航智能体,并附带一个用于生成兼容 Habitat 仿真器的目标导航任务剧集的插件。此外,我们提供两个预生成的目标导航任务数据集,SD-OVON-3k 和 SD-OVON-10k,分别包含约 3k 和 10k 个开放词汇目标导航任务剧集,这些剧集源自 SD-OVON-Scenes 数据集(包含 2.5k 个照片写实扫描的真实环境)和 SD-OVON-Objects 数据集(包含 0.9k 个人工检查的扫描和精心创建的可操作物体模型)。与以前仅限于静态环境的数据集不同,SD-OVON 涵盖动态场景和可操作物体,促进了真实到仿真以及仿真到真实的机器人应用。这种方法提高了导航任务的真实性,在复杂环境中训练和评估开放词汇目标导航智能体的能力。为证明 our pipeline 和数据集的有效性,我们提出了两个基线模型,并在 SD-OVON-3k 上对其以及最先进的基线模型进行了评估。该数据集、基准测试和源代码均公开可用。

关键词

引用

@article{arxiv.2505.18881,
  title  = {SD-OVON: A Semantics-aware Dataset and Benchmark Generation Pipeline for Open-Vocabulary Object Navigation in Dynamic Scenes},
  author = {Dicong Qiu and Jiadi You and Zeying Gong and Ronghe Qiu and Hui Xiong and Junwei Liang},
  journal= {arXiv preprint arXiv:2505.18881},
  year   = {2025}
}

备注

Preprint. 21 pages