用于具身指代表达定位的布局感知 Dreamer
计算机视觉与模式识别
2022-12-05 v2 人工智能
机器学习
摘要
在这项工作中,我们研究具身指代表达定位问题,其中智能体需要在未见过的环境中导航,并定位由简洁的高阶自然语言指令描述的远程目标。面对这种情况时,人类倾向于想象目的地的样子,并基于对环境布局的先验知识来探索环境,例如浴室比厨房更可能在卧室附近。我们设计了一个名为布局感知 Dreamer (LAD) 的自主智能体,包含两个新模块,即布局学习器和目标想象器,以模仿这种认知决策过程。布局学习器学习推断沿路径相邻未探索区域的房间类别分布,以进行粗略的布局估计,这有效地将房间间过渡的布局常识引入到我们的智能体中。为了学习对环境的有效探索,目标想象器事先想象目的地。我们的智能体在 REVERIE 数据集的公共排行榜上,在具有挑战性的未见测试环境中取得了新的 SOTA 性能,与之前的 SOTA 相比,导航成功率 (SR) 提高了 4.02%,远程定位成功率 (RGS) 提高了 3.43%。代码已发布于 https://github.com/zehao-wang/LAD
引用
@article{arxiv.2212.00171,
title = {Layout-aware Dreamer for Embodied Referring Expression Grounding},
author = {Mingxiao Li and Zehao Wang and Tinne Tuytelaars and Marie-Francine Moens},
journal= {arXiv preprint arXiv:2212.00171},
year = {2022}
}