基于大语言模型的分层语言代理用于实时人机协调
人工智能
2024-01-10 v2 人机交互
摘要
由大语言模型(LLM)驱动的AI代理取得了显著进展,使其能够协助人类完成各种复杂任务,并引发了人机协调的革命。基于LLM的代理通常需要调用LLM API并使用人工设计的复杂提示,这导致推理延迟高。虽然这种范式在代码生成等交互需求较少的场景中效果良好,但不适用于高度交互和实时的应用,例如游戏。传统的游戏AI通常采用小模型或反应式策略,推理速度快,但任务完成和交互能力有限。在这项工作中,我们将Overcooked作为测试平台,玩家可以通过自然语言进行交流并合作完成订单。我们提出了一种用于人机协调的分层语言代理(HLA),它既提供强大的推理能力,又保持实时执行。具体而言,HLA采用分层框架,包含三个模块:一个熟练的LLM(称为慢思维),用于意图推理和语言交互;一个轻量级LLM(称为快思维),用于生成宏观动作;以及一个反应式策略(称为执行器),用于将宏观动作转换为原子动作。人类研究表明,HLA优于其他基线代理(包括仅慢思维代理和仅快思维代理),具有更强的协作能力、更快的响应速度和更一致的语言交流。
引用
@article{arxiv.2312.15224,
title = {LLM-Powered Hierarchical Language Agent for Real-time Human-AI Coordination},
author = {Jijia Liu and Chao Yu and Jiaxuan Gao and Yuqing Xie and Qingmin Liao and Yi Wu and Yu Wang},
journal= {arXiv preprint arXiv:2312.15224},
year = {2024}
}
备注
This paper is accpeted by AAMAS 2024. More demonstrations can be seen on our website https://sites.google.com/view/overcooked-hla/