Embodied BERT:一种用于具身、语言引导视觉任务完成的 Transformer 模型
计算机视觉与模式识别
2021-11-05 v2 人工智能
计算与语言
机器学习
摘要
执行家庭与办公室任务的语言引导机器人必须在世界中导航并与之交互。将语言指令与视觉观测及环境中待采取的动作进行接地是一项开放挑战。我们提出 Embodied BERT(EmBERT),一种基于 transformer 的模型,能够关注长时域上的高维、多模态输入以完成语言条件任务。此外,我们通过为 EmBERT 训练引入物体导航目标,弥合了用于非交互智能体的成功物体中心导航模型与语言引导视觉任务完成基准 ALFRED 之间的差距。我们在 ALFRED 基准上取得了有竞争力的表现,且 EmBERT 是首个成功处理 ALFRED 长时域、密集、多模态历史的基于 transformer 的模型,也是首个利用物体中心导航目标的 ALFRED 模型。
引用
@article{arxiv.2108.04927,
title = {Embodied BERT: A Transformer Model for Embodied, Language-guided Visual Task Completion},
author = {Alessandro Suglia and Qiaozi Gao and Jesse Thomason and Govind Thattai and Gaurav Sukhatme},
journal= {arXiv preprint arXiv:2108.04927},
year = {2021}
}
备注
Accepted at Novel Ideas in Learning-to-Learn through Interaction (NILLI) workshop @ EMNLP 2021