通过黑盒环境交互探究大语言模型的高级推理能力
人工智能
2026-05-07 v2
摘要
现有任务在评估大语言模型(Large Language Models, LLMs)在交互式未知环境中的推理能力方面存在不足。这一缺陷导致了对演绎、归纳和溯因推理的孤立评估,忽略了类人发现学习所不可或缺的综合推理过程。我们引入了一种新颖的评估范式——\textit{黑盒环境交互},以应对这一挑战。黑盒环境由一个将特定输入集映射到输出的隐藏函数定义。LLMs 被要求通过在给定的探索回合中与黑盒环境交互,并对观察到的输入-输出对进行推理,来揭示黑盒环境背后的隐藏函数。基于这一思想,我们构建了 \textsc{Oracle} 基准,该基准包含 6 种类型的黑盒任务,共 96 个黑盒环境。我们对 19 个现代 LLM 进行了基准测试。OpenAI 的领先 LLM o3 在 6 项任务中的 5 项中排名第一,在大多数简单黑盒环境上达到了超过 70\% 的准确率。但它仍然在一些困难的黑盒任务中挣扎,平均性能降至 40\% 以下。进一步分析揭示了 LLM 普遍存在的一个困难:它们缺乏制定高效且自适应的探索策略以进行假设精炼的高层规划能力。代码可在 https://github.com/lemonsis/Oracle_Benchmark 获取。
引用
@article{arxiv.2508.19035,
title = {Investigating Advanced Reasoning of Large Language Models via Black-Box Environment Interaction},
author = {Congchi Yin and Tianyi Wu and Yankai Shu and Alex Gu and Yunhan Wang and Jun Shao and Xun Jiang and Piji Li},
journal= {arXiv preprint arXiv:2508.19035},
year = {2026}
}
备注
Accepted by ICML 2026