中文

Retrospex:语言智能体遇见离线强化学习评论家

统计方法学 2025-11-19 v2

摘要

大型语言模型(LLM)拥有广泛的知识和常识推理能力,因而在创建强大智能体方面具有重要价值。然而,现有的LLM智能体框架尚未充分利用过往经验进行改进。本工作引入一种新的LLM-based智能体框架,称为Retrospex,通过深入分析过往经验来实现这一目标。不同于以往方法,Retrospex不直接将经验整合到LLM的上下文中,而是将LLM的动作概率与通过离线“回顾”过程在过往经验上训练的强化学习(RL)评论家估计的动作价值相结合。此外,Retrospex采用动态动作重排序机制,对于需要与环境更多交互的任务,提高经验价值的重要性。我们在ScienceWorld、ALFWorld和Webshop环境中评估了Retrospex,证明其优于强大且最新方法的优势。

关键词

引用

@article{arxiv.2505.11806,
  title  = {Robust normality transformation for outlier detection in diverse distributions, with application to functional neuroimaging data},
  author = {Saranjeet Singh Saluja and Fatma Parlak and Amanda Mejia},
  journal= {arXiv preprint arXiv:2505.11806},
  year   = {2025}
}