中文

作为元强化学习副产品的简单具身语言学习

计算与语言 2023-06-16 v1 人工智能 机器学习

摘要

机器学习模型通常通过在语言任务上直接训练(例如下一词预测)来学习语言,而人类儿童的语言是作为解决非语言任务(例如获取食物)的副产品出现的。受此观察启发,我们提问:具身强化学习(RL)智能体是否也能从非语言任务中间接学习语言?将语言与其含义相关联需要具有丰富语言变化的动态环境。因此,我们在一个跨不同任务语言变化的多任务环境中研究该问题。具体而言,我们设计了一个办公室导航环境,智能体的目标是找到特定办公室,且办公室位置在不同建筑(即任务)中不同。每栋建筑包含带有目标办公室位置简单语言描述的楼层平面图,当访问时可将其作为 RGB 图像视觉读取。我们发现 RL 智能体确实能够间接学习语言。使用当前元 RL 算法训练的智能体成功泛化到读取具有留出布局与语言短语的楼层平面图,并快速导航至正确办公室,尽管未接收任何直接语言监督。

关键词

引用

@article{arxiv.2306.08400,
  title  = {Simple Embodied Language Learning as a Byproduct of Meta-Reinforcement Learning},
  author = {Evan Zheran Liu and Sahaana Suri and Tong Mu and Allan Zhou and Chelsea Finn},
  journal= {arXiv preprint arXiv:2306.08400},
  year   = {2023}
}

备注

International Conference on Machine Learning (ICML), 2023