中文

Box Maze:可靠 LLM 推理的过程控制架构

人工智能 2026-03-20 v1 计算与语言

摘要

大型语言模型(LLM)表现出强大的生成能力,但在对抗性提示下仍易产生幻觉并不可靠地进行推理。现有的安全方法——如基于人类反馈的强化学习(RLHF)和输出过滤——主要在行为层面运作,可能缺乏用于强制执行推理过程完整性的明确架构机制。本文提出Box Maze框架,一种概念过程控制架构,将 LLM 推理分解为三个明确层次:记忆锚定、结构推理与边界 enforcement。我们引入基于模拟的初步评估,涉及跨多个异构 LLM 系统(DeepSeek-V3、豆包、Qwen)中的渐进式边界侵蚀情景。来自n=50个对抗情景的测试结果表明,明确的认知控制层次可能改善边界维护的一致性,架构约束将边界失效率从约40%(基线RLHF)降至<1%。虽然当前验证基于模拟,但这些初步结果指出过程级控制可能为改进大型语言模型推理可靠性提供了有前景的方向。

关键词

引用

@article{arxiv.2603.19182,
  title  = {Box Maze: A Process-Control Architecture for Reliable LLM Reasoning},
  author = {Zou Qiang},
  journal= {arXiv preprint arXiv:2603.19182},
  year   = {2026}
}

备注

10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation