Retrospex:语言智能体遇见离线强化学习评论家
统计方法学
2025-11-19 v2
摘要
大型语言模型(LLM)拥有广泛的知识和常识推理能力,因而在创建强大智能体方面具有重要价值。然而,现有的LLM智能体框架尚未充分利用过往经验进行改进。本工作引入一种新的LLM-based智能体框架,称为Retrospex,通过深入分析过往经验来实现这一目标。不同于以往方法,Retrospex不直接将经验整合到LLM的上下文中,而是将LLM的动作概率与通过离线“回顾”过程在过往经验上训练的强化学习(RL)评论家估计的动作价值相结合。此外,Retrospex采用动态动作重排序机制,对于需要与环境更多交互的任务,提高经验价值的重要性。我们在ScienceWorld、ALFWorld和Webshop环境中评估了Retrospex,证明其优于强大且最新方法的优势。
引用
@article{arxiv.2505.11806,
title = {Robust normality transformation for outlier detection in diverse distributions, with application to functional neuroimaging data},
author = {Saranjeet Singh Saluja and Fatma Parlak and Amanda Mejia},
journal= {arXiv preprint arXiv:2505.11806},
year = {2025}
}