中文

LLM-Cave:面向大语言模型推理与决策系统的基准与轻量环境

机器学习 2025-12-01 v1

摘要

大型语言模型(LLM)如 ChatGPT o1、ChatGPT o3 和 DeepSeek R1 在解决复杂问题方面显示出巨大的潜力。然而,当前的 LLM 评估基准仅限于单步交互。一些现有的序列决策环境,如 TextStarCraftII 和 LLM-PySC2,过于复杂,需要数小时才能完成游戏。在本文中,我们引入了 LLM-Cave,一个面向大语言模型推理与决策系统的基准与轻量环境。该环境是符号主义时代的经典实例。人工智能通过推理附近危险、利用部分可观测状态信息来探索环境并规避潜在损失。在实验中,我们评估了主流大型语言模型(LLM)如 GPT-4o-mini、o1-mini 和 DeepSeek-R1 的顺序推理能力、决策性能和计算效率。实验表明,尽管 DeepSeek-R1 在复杂推理任务中实现了最高的成功率,但较小的模型如 4o-mini 通过采用 Chain of Speculation 和 Planner-Critic 策略,在挑战性任务中显著缩小了与最佳模型的性能差距,尽管以计算效率降低为代价。这表明,结构化的多步骤推理结合 LLM 基于反馈的机制可以显著提升 LLM 的决策能力,为改进弱模型的推理提供了可行路径,并为 LLM 评估提出了新的以推理为中心的基准。我们的代码已在 https://github.com/puleya1277/CaveEnv 上开源。

关键词

引用

@article{arxiv.2511.22598,
  title  = {LLM-Cave: A benchmark and light environment for large language models reasoning and decision-making system},
  author = {Huanyu Li and Zongyuan Li and Wei Huang and Xian Guo},
  journal= {arXiv preprint arXiv:2511.22598},
  year   = {2025}
}

备注

8 pages, 5 figures, ICICN 2025