中文

选择性感知:利用强化学习优化语言模型执行器的状态描述

机器学习 2023-07-25 v1 人工智能 计算与语言

摘要

大语言模型(LLMs)正作为执行器被应用于机器人与游戏等领域的序贯决策任务,利用其通用世界知识与规划能力。然而,以往工作鲜少探究通过语言向LLM执行器提供何种环境状态信息。详尽描述高维状态会损害LLM执行器性能并增加推理成本。以往的LLM执行器通过依赖手工设计的特定任务协议来决定状态中哪些特征需传达、哪些可省略,从而规避该问题。本工作中,我们提出BLINDER(用于决策响应的简练语言输入,Brief Language INputs for DEcision-making Responses),一种通过学习任务条件状态描述的价值函数自动选择简洁状态描述的方法。我们在具有挑战性的视频游戏NetHack与一项机器人操控任务上评估BLINDER。我们的方法提升了任务成功率,减小了输入规模与计算成本,并在不同LLM执行器间具有泛化能力。

关键词

引用

@article{arxiv.2307.11922,
  title  = {Selective Perception: Optimizing State Descriptions with Reinforcement Learning for Language Model Actors},
  author = {Kolby Nottingham and Yasaman Razeghi and Kyungmin Kim and JB Lanier and Pierre Baldi and Roy Fox and Sameer Singh},
  journal= {arXiv preprint arXiv:2307.11922},
  year   = {2023}
}