中文

VALAN:视觉与语言智能体导航

机器学习 2019-12-09 v1 机器学习

摘要

VALAN 是一个基于 SEED RL 架构的轻量级、可扩展深度强化学习软件框架。该框架促进了具身智能体在逼真环境(如 Matterport3D 和 Google StreetView)中解决接地语言理解任务(如视觉-语言导航与视觉-对话导航)的开发与评估。我们在 SEED RL 之上添加了极少的抽象,使架构可推广至解决多种其他 RL 问题。本文将描述 VALAN 的软件抽象与架构,并给出使用 VALAN 设计指令条件室内导航智能体的示例。

关键词

引用

@article{arxiv.1912.03241,
  title  = {VALAN: Vision and Language Agent Navigation},
  author = {Larry Lansing and Vihan Jain and Harsh Mehta and Haoshuo Huang and Eugene Ie},
  journal= {arXiv preprint arXiv:1912.03241},
  year   = {2019}
}