VALAN:视觉与语言智能体导航
机器学习
2019-12-09 v1 机器学习
摘要
VALAN 是一个基于 SEED RL 架构的轻量级、可扩展深度强化学习软件框架。该框架促进了具身智能体在逼真环境(如 Matterport3D 和 Google StreetView)中解决接地语言理解任务(如视觉-语言导航与视觉-对话导航)的开发与评估。我们在 SEED RL 之上添加了极少的抽象,使架构可推广至解决多种其他 RL 问题。本文将描述 VALAN 的软件抽象与架构,并给出使用 VALAN 设计指令条件室内导航智能体的示例。
引用
@article{arxiv.1912.03241,
title = {VALAN: Vision and Language Agent Navigation},
author = {Larry Lansing and Vihan Jain and Harsh Mehta and Haoshuo Huang and Eugene Ie},
journal= {arXiv preprint arXiv:1912.03241},
year = {2019}
}