DPEPO:面向基于 LLM 智能体的多样化并行探索策略优化
计算与语言
2026-04-28 v1
摘要
遵循顺序“推理-行动”范式的大语言模型(LLM)智能体在许多复杂任务中取得了卓越的性能。然而,这些方法因仅在每个步骤与单个环境交互,存在探索有限和环境理解不完整的问题。本文首先引入一种新范式,使智能体能够同时与多个环境交互并共享跨轨迹经验。基于此范式,我们进一步提出DPEPO,这是一种强化学习(RL)算法,旨在鼓励智能体执行多样化的并行探索。DPEPO包含两个阶段:初始的监督微调(SFT)赋予基本的并行推理和动作生成能力,随后是采用分层奖励方案的强化学习阶段。我们设计了轨迹级别的成功奖励以及两个步骤级别的奖励:多样化动作奖励和多样化状态转移奖励,这些奖励主动惩罚行为冗余,促进广泛探索。在ALFWorld和ScienceWorld上的大量实验表明,DPEPO实现了最先进(SOTA)的成功率,同时保持了与强序列表达基线相当的效率。(代码已公开:https://github.com/LePanda026/Code-for-DPEPO)
引用
@article{arxiv.2604.24320,
title = {DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents},
author = {Junshuo Zhang and Chengrui Huang and Feng Guo and Zihan Li and Ke Shi and Menghua Jiang and Jiguo Yu and Shuo Shang and Shen Gao},
journal= {arXiv preprint arXiv:2604.24320},
year = {2026}
}
备注
Accepted by ACL 2026 main conference