可访问的指令跟随智能体
人工智能
2023-05-12 v1 计算与语言
摘要
人类可以基于来自环境的视觉信号和指令进行协作并完成任务。训练这样的机器人尤其困难,原因在于对指令的理解以及复杂的环境。以往的指令跟随智能体偏向于以英语为中心的语料,使其无法应用于使用多种语言甚至低资源语言的用户。此外,指令跟随智能体以一种假设用户可观察环境的模式进行预训练,这限制了其可访问性。在这项工作中,我们试图将指令跟随智能体的成功推广到语料资源匮乏的非英语语言,并提升其可处理性与可访问性。我们引入了 UVLN(通用视觉-语言导航),一种用于跨语言视觉-语言导航的新型机器翻译指令增强框架,其新颖地组合了最先进的大语言模型(GPT3)与图像描述模型(BLIP)。我们首先通过机器翻译收集了一个多语言视觉-语言导航数据集。然后,我们通过跨语言语言编码器将标准 VLN 训练目标扩展到多语言设置。不同语言之间的对齐通过共享视觉与动作上下文经由跨模态 transformer 捕获,该 transformer 对语言指令、视觉观察和动作决策序列的输入进行编码。为提升可处理性,我们将智能体与大语言模型连接,该模型向用户告知情境与当前状态并解释动作决策。在 Room Across Room 数据集上的实验证明了我们方法的有效性。定性结果表明我们的指令跟随智能体具有可观的可处理性与可访问性。
引用
@article{arxiv.2305.06358,
title = {Accessible Instruction-Following Agent},
author = {Kairui Zhou},
journal= {arXiv preprint arXiv:2305.06358},
year = {2023}
}