中文

通过重新引入马尔可夫状态打破大语言模型后训练的能力上限

机器学习 2026-03-23 v1 人工智能 计算与语言

摘要

强化学习(RL)已成为大语言模型(LLM)后训练与对齐的标准范式,但近期研究表明其面临一个持续存在的“能力上限”:与经典RL系统能够发现新策略不同,LLM的RL后训练往往仅是对预训练权重中已潜在存在的模式进行微调。在本工作中,我们识别出一个根本性的结构瓶颈:经典RL依赖紧凑且信息丰富的马尔可夫状态,而当前LLM后训练公式则绑定于不断扩展的动作历史。我们重新审视一个长期处于RL核心但LLM后训练中缺失的经典原则——显式马尔可夫状态。理论上,我们提供了严格的理论保证,表明利用估计的马尔可夫状态可以显著降低样本复杂度。经验上,我们证明引入马尔可夫状态能够在复杂逻辑谜题套件中一致地打破标准RL后训练的性能边界。我们的发现表明,超越“以历史为状态”的建模,转向结构化的马尔可夫表示,对于在生成式人工智能中解锁开放式发现和真正新的推理能力至关重要。

关键词

引用

@article{arxiv.2603.19987,
  title  = {Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States},
  author = {Yurun Yuan and Tengyang Xie},
  journal= {arXiv preprint arXiv:2603.19987},
  year   = {2026}
}