基于 Transformer 的具身对话定位与大规模预训练
计算机视觉与模式识别
2022-10-11 v1 人工智能
计算与语言
摘要
我们解决了具身对话定位(LED)这一具有挑战性的任务。给定两个智能体之间的对话——一个在未知环境中导航的观察者和一个试图确定观察者位置的定位者——目标是在地图中预测观察者的最终位置。我们开发了新颖的 LED-Bert 架构并提出了一种有效的预训练策略。我们表明基于图的场景表示比先前工作中使用的自上而下的 2D 地图更有效。我们的方法优于先前的基线。
引用
@article{arxiv.2210.04864,
title = {Transformer-based Localization from Embodied Dialog with Large-scale Pre-training},
author = {Meera Hahn and James M. Rehg},
journal= {arXiv preprint arXiv:2210.04864},
year = {2022}
}