中文

用于具身指代表达定位的布局感知 Dreamer

计算机视觉与模式识别 2022-12-05 v2 人工智能 机器学习

摘要

在这项工作中,我们研究具身指代表达定位问题,其中智能体需要在未见过的环境中导航,并定位由简洁的高阶自然语言指令描述的远程目标。面对这种情况时,人类倾向于想象目的地的样子,并基于对环境布局的先验知识来探索环境,例如浴室比厨房更可能在卧室附近。我们设计了一个名为布局感知 Dreamer (LAD) 的自主智能体,包含两个新模块,即布局学习器和目标想象器,以模仿这种认知决策过程。布局学习器学习推断沿路径相邻未探索区域的房间类别分布,以进行粗略的布局估计,这有效地将房间间过渡的布局常识引入到我们的智能体中。为了学习对环境的有效探索,目标想象器事先想象目的地。我们的智能体在 REVERIE 数据集的公共排行榜上,在具有挑战性的未见测试环境中取得了新的 SOTA 性能,与之前的 SOTA 相比,导航成功率 (SR) 提高了 4.02%,远程定位成功率 (RGS) 提高了 3.43%。代码已发布于 https://github.com/zehao-wang/LAD

关键词

引用

@article{arxiv.2212.00171,
  title  = {Layout-aware Dreamer for Embodied Referring Expression Grounding},
  author = {Mingxiao Li and Zehao Wang and Tinne Tuytelaars and Marie-Francine Moens},
  journal= {arXiv preprint arXiv:2212.00171},
  year   = {2022}
}