面向视觉-语言导航的自监督三维语义表示学习
计算机视觉与模式识别
2022-01-27 v1 机器人学
摘要
在视觉-语言导航任务中,具身智能体遵循语言指令并导航至特定目标。该任务在许多实际场景中十分重要,并已引起计算机视觉与机器人学界的广泛关注。然而,大多数现有工作仅使用 RGB 图像而忽略了场景的三维语义信息。为此,我们提出了一种新颖的自监督训练框架,将体素级三维语义重建编码为三维语义表示。具体而言,设计了一个区域查询任务作为 pretext task(预训练任务),用于预测特定三维区域中是否存在某特定类别的物体。随后,我们构建了一个基于 LSTM 的导航模型,并使用所提出的三维语义表示与 BERT 语言特征在视觉-语言对上进行训练。实验表明,所提方法在 R2R 数据集的验证未见过(validation unseen)与测试未见过(test unseen)划分上分别取得了 68% 和 66% 的成功率,优于大多数利用视觉-语言 transformer 的基于 RGB 的方法。
引用
@article{arxiv.2201.10788,
title = {Self-supervised 3D Semantic Representation Learning for Vision-and-Language Navigation},
author = {Sinan Tan and Mengmeng Ge and Di Guo and Huaping Liu and Fuchun Sun},
journal= {arXiv preprint arXiv:2201.10788},
year = {2022}
}