用于视觉运动语言落地的模块化框架
人工智能
2021-09-07 v1
摘要
自然语言指令跟随任务可作为具身语言与机器人研究的有价值测试平台。然而,这些任务的数据收集代价高昂,且端到端方法存在数据效率低下的问题。我们提出将语言、动作与视觉任务结构化为可独立训练的分离模块。使用语言、动作与视觉 (LAV) 框架消除了动作与视觉模块对指令跟随数据集的依赖,使其训练更为高效。我们还给出了 LAV 在 ALFRED 视觉与交互式指令跟随任务上的初步评估。
引用
@article{arxiv.2109.02161,
title = {Modular Framework for Visuomotor Language Grounding},
author = {Kolby Nottingham and Litian Liang and Daeyun Shin and Charless C. Fowlkes and Roy Fox and Sameer Singh},
journal= {arXiv preprint arXiv:2109.02161},
year = {2021}
}