AdaRefiner:利用自适应反馈精炼语言模型的决策
人工智能
2024-05-06 v3 计算与语言
摘要
大语言模型(LLMs)已在多个领域展现出显著成功。然而,其在复杂决策任务中的应用常常需要精巧的提示工程或微调,导致在未见过的下游任务中面临挑战,并对计算资源提出高需求。同时,强化学习(RL)在决策问题中被证明有效,但在具有稀疏奖励的环境中(如开放世界游戏)表现不佳。为克服这些挑战,我们提出 AdaRefiner,一种旨在增强 LLMs 与 RL 反馈之间协同作用的新框架。AdaRefiner 的关键组件是一个轻量级适配器语言模型(Adapter LM),它基于 RL 智能体的反馈自动精炼任务理解。该方法减轻了对精巧提示工程和密集 LLM 微调的需求,同时保持了 LLMs 的泛化能力并增强了其在下游任务中的决策能力。在开放世界游戏 Crafter 中 22 个多样化任务上对 AdaRefiner 的实证评估证明了其卓越有效性,尤其在引导智能体习得更高层次与常识性技能方面。我们的工作对利用 RL 反馈实现 LLMs 的自动自精炼做出了贡献,为复杂决策问题提供了更具适应性与高效的解决方案。
引用
@article{arxiv.2309.17176,
title = {AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback},
author = {Wanpeng Zhang and Zongqing Lu},
journal= {arXiv preprint arXiv:2309.17176},
year = {2024}
}