中文

探索并描述:三维环境中的具身视觉描述生成

计算机视觉与模式识别 2023-08-22 v1

摘要

尽管当前的视觉描述生成模型已取得令人印象深刻的性能,它们通常假设图像已被良好捕获并提供场景的完整视图。然而,在真实场景中,单张图像可能无法提供良好视角,阻碍细粒度场景理解。为克服此限制,我们提出一项称为具身描述生成(Embodied Captioning)的新任务,其为视觉描述生成模型配备导航能力,使它们能够主动探索场景并减少来自次优视角的视觉歧义。具体而言,从随机视角出发,智能体必须导航环境以从不同视角收集信息,并生成描述场景中所有物体的完整段落。为支持该任务,我们使用 Kubric 模拟器构建了 ET-Cap 数据集,包含 10K 个具有杂乱物体的三维场景,每个场景有三个标注段落。我们提出级联具身描述生成模型(CaBOT),由导航器和描述生成器组成,以应对该任务。导航器预测在环境中采取的动作,而描述生成器基于整个导航轨迹生成段落描述。大量实验表明我们的模型优于其他精心设计的基线。我们的数据集、代码和模型可在 https://aim3-ruc.github.io/ExploreAndTell 获取。

关键词

引用

@article{arxiv.2308.10447,
  title  = {Explore and Tell: Embodied Visual Captioning in 3D Environments},
  author = {Anwen Hu and Shizhe Chen and Liang Zhang and Qin Jin},
  journal= {arXiv preprint arXiv:2308.10447},
  year   = {2023}
}

备注

12 pages; 10 figures; ICCV 2023