Lana:一种支持指令跟随与生成的语言能力导航器
计算机视觉与模式识别
2023-03-16 v1 多媒体
机器人学
摘要
近来,视觉语言导航(VLN)——即让机器人智能体跟随导航指令——已取得巨大进展。然而,现有文献大多侧重于将指令解释为动作,仅产出“笨”的寻路智能体。本文中,我们设计了LANA,一种具备语言能力的导航智能体,它不仅能执行人类书写的导航命令,还能向人类提供路线描述。这是通过仅用单一模型同时学习指令跟随与生成来实现的。更具体地,构建了分别用于路线和语言编码的两个编码器,并由分别用于动作预测和指令生成的两个解码器共享,以利用跨任务知识并捕捉任务特定特征。在预训练与微调过程中,指令跟随与生成均被设为优化目标。我们经实证验证,与近期先进的任务专用方案相比,LANA在指令跟随和路线描述上均取得更好性能,且复杂度近乎减半。此外,凭借语言生成能力,LANA可向人类解释其行为并辅助人类寻路。本工作有望推动未来构建更可信且具社会智能的导航机器人的努力。
引用
@article{arxiv.2303.08409,
title = {Lana: A Language-Capable Navigator for Instruction Following and Generation},
author = {Xiaohan Wang and Wenguan Wang and Jiayi Shao and Yi Yang},
journal= {arXiv preprint arXiv:2303.08409},
year = {2023}
}
备注
Accepted to CVPR 2023