结构化 in-context 环境扩展:大语言模型推理的框架
计算与语言
2026-05-04 v3
摘要
大语言模型 (LLM) 已通过环境探索实现了强化学习在推理能力上的显著提升。由于环境的内在属性决定了 LLM 能学习的能力,环境在 RL 微调过程中发挥着重要作用。理想的 LLM 推理环境应具备三大核心特征:可扩展性、可泛化的推理能力以及可验证性。然而,现有的基于数学和编程的环境因高度依赖专家标注而难以扩展,而游戏式环境中学习到的技能过于专业,难以泛化。为弥合这一差距,我们引入了结构化 in-context 环境 (SIE) 框架。SIE 通过自动从大规模结构化数据构建推理环境,实现可扩展性,同时丰富的组成模式自然支持可泛化的推理。此外,结构化数据中明确的模式与推理链为基于规则的可验证性提供了基础。实验结果表明,SIE 框架不仅在领域内结构化推理方面取得显著提升,更能使所学的组成推理技能在出域的数学和逻辑推理任务中有效泛化。我们进一步探索了在信息受限的部分 SIE 中的学习情况,发现 LLM 可通过探索环境推断缺失信息,从而实现鲁棒的推理提升和泛化性能。
关键词
引用
@article{arxiv.2509.23330,
title = {Structured In-context Environment Scaling for Large Language Model Reasoning},
author = {Peng Yu and Zeyuan Zhao and Shao Zhang and Luoyi Fu and Xinbing Wang and Ying Wen},
journal= {arXiv preprint arXiv:2509.23330},
year = {2026}
}
备注
Title modified for greater clarity and better alignment with the paper's focus