中文

计算机环境可引发大语言模型中的通用智能

计算与语言 2026-04-09 v3 人工智能

摘要

大语言模型(LLMs)中的智能行为不仅依赖于模型的内在能力,还需要与外部环境的交互。为 LLMs 配备计算机已成为主流趋势。然而,计算机环境的内在价值尚未系统性地被研究,尤其是其潜在的引发通用能力方面。本文引入 LLM-in-Sandbox,通过将计算机虚拟化为仅具基本功能的代码沙箱,展示了这一最小设置可引发 LLMs 实现通用任务解决的计算机基础能力:外部资源访问、文件管理和代码执行。无需额外训练,强大模型在数学、物理、化学、生物医学、长文本理解和指令遵循等方面实现显著提升(最高提升 15.5%),同时将 token 消耗降低最高可达 8 倍。此外,我们开发了 LLM-in-Sandbox-RL,通过仅在沙箱内使用非智能数据训练模型,使较弱模型能够利用环境并内化这些交互。我们的结果表明,计算机环境可引发通用智能,实现效率提升,并可通过训练加以利用,为通用智能体提供了有前景的基础。

关键词

引用

@article{arxiv.2601.16206,
  title  = {Computer Environments Elicit General Agentic Intelligence in LLMs},
  author = {Daixuan Cheng and Shaohan Huang and Yuxian Gu and Huatong Song and Guoxin Chen and Li Dong and Wayne Xin Zhao and Ji-Rong Wen and Furu Wei},
  journal= {arXiv preprint arXiv:2601.16206},
  year   = {2026}
}

备注

Project Page: https://llm-in-sandbox.github.io