中文

用大语言模型增强自目标智能体

人工智能 2023-05-23 v1 计算与语言 机器学习

摘要

人类通过想象并练习自身目标,学会掌握开放式的技能库。这一自目标学习过程,字面意义上即追求自我生成的(auto)目标(telos),随着目标变得愈发多样、抽象与富有创造性,而变得越来越开放。由此对可能技能空间的探索得到个体间探索的支持:目标表征在文化上演化并在个体间传递,尤其是借助语言。当前人工智能体大多依赖预定义的目标表征,对应于要么有界(如指令列表)、要么无界(如可能视觉输入的空间)的目标空间,却极少具备重塑其目标表征、形成新抽象或想象创造性目标的能力。本文中,我们引入一种语言模型增强的自目标智能体(LMA3),其利用预训练语言模型(LM)来支持多样、抽象、与人类相关的目标的表征、生成与学习。该 LM 被用作人类文化传递的不完美模型;一种对人类常识、直觉物理及总体兴趣的捕捉尝试。具体而言,它支持自目标架构的三个关键组件:1)一个重标器,描述智能体轨迹中所实现的目标;2)一个目标生成器,提出新的高层目标并将其分解为智能体已掌握的子目标;3)各目标的奖励函数。在无需任何手工编码的目标表征、奖励函数或课程的前提下,我们展示 LMA3 智能体在任务无关的基于文本的环境中学会掌握大量多样化技能。

关键词

引用

@article{arxiv.2305.12487,
  title  = {Augmenting Autotelic Agents with Large Language Models},
  author = {Cédric Colas and Laetitia Teodorescu and Pierre-Yves Oudeyer and Xingdi Yuan and Marc-Alexandre Côté},
  journal= {arXiv preprint arXiv:2305.12487},
  year   = {2023}
}