通过步骤级 Q 值模型提升大语言模型智能体的决策能力
人工智能
2024-09-17 v1
摘要
智能体通过感知环境、做出决策和执行动作来显著增强独立大语言模型(LLM)的能力。然而,LLM 智能体在需要多步骤决策的任务中仍面临挑战。当中间动作既未获得适当奖励也未受到适当惩罚时,估计特定任务中动作的价值就十分困难。本文提出利用与任务相关的 Q 值模型来指导动作选择。具体而言,我们首先通过蒙特卡洛树搜索(MCTS)收集带有步骤级 Q 值注释的决策轨迹,以构建偏好数据。随后,我们使用另一个 LLM 通过步骤级直接策略优化(DPO)拟合这些偏好,作为 Q 值模型。在推理过程中,LLM 智能体在与环境交互前选择具有最高 Q 值的动作。我们将方法应用于各种开源和基于 API 的 LLM 智能体,证明 Q 值模型显著提升了其性能。值得注意的是, even with Q 值模型增强后,使用 Phi-3-mini-4k-instruct 构建的智能体在 WebShop 上的性能提升了 103%,在 HotPotQA 上的性能提升了 75%,甚至超过了 GPT-4o-mini。此外,Q 值模型还提供了若干优势,如对不同 LLM 智能体的泛化能力,以及与现有提示策略的无缝集成。
引用
@article{arxiv.2409.09345,
title = {Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models},
author = {Yuanzhao Zhai and Tingkai Yang and Kele Xu and Feng Dawei and Cheng Yang and Bo Ding and Huaimin Wang},
journal= {arXiv preprint arXiv:2409.09345},
year = {2024}
}