中文

DORA Explorer:无需训练提升 LLM 代理探索能力

计算与语言 2026-04-21 v1 人工智能

摘要

尽管取得了快速进展,针对序列决策问题的大语言模型(即 LLM 代理)仍难以产生多样化的输出。这导致探索不足、收敛于亚最优解,甚至陷入循环。此类局限在需要主动探索以获取信息并作出决策的环境中尤为棘手。诸如温度抽样等抽样方法虽引入了基于标记的随机性,却难以在序列层面产生足够的多样性。我们分别在经典的多臂老虎机(MAB)设置以及 Text Adventure Learning Environment Suite(TALES)中分析 LLM 的探索行为。我们发现当前的解码策略和诸如链式思考(Chain-of-Thought)与树状思考(Tree-of-Thought)等提示方法对鲁健探索并不充分。为此,我们提出DORA Explorer(Diversity-Oriented Ranking of Actions),一个无需训练的 LLM 代理探索提升框架。DORA 生成多样化的动作候选方案,依据标记对数概率对其进行评分,然后通过可调节的探索参数进行动作选择。DORA 在 MAB 上实现了与 UCB 相当的性能,并在 TALES 上稳定地取得改进,例如将 Qwen2.5-7B 在 TextWorld 上的表现提升至 29.2% 至 45.5%。我们的项目已开源发布于 https://dora-explore.github.io/。

关键词

引用

@article{arxiv.2604.17244,
  title  = {DORA Explorer: Improving the Exploration Ability of LLMs Without Training},
  author = {Priya Gurjar and Md Farhan Ishmam and Kenneth Marino},
  journal= {arXiv preprint arXiv:2604.17244},
  year   = {2026}
}

备注

17 pages, 3 Figures, 10 tables