中文

后训练即重新加权:语言模型推理轨迹的随机视角

机器学习 2026-01-21 v2 人工智能

摘要

基础模型编码丰富的结构知识,但通常依赖后训练程序来调整其推理行为以适应特定任务。诸如强化学习可验证奖励(RLVR)和推理时奖励聚合等流行方法通常从性能角度进行分析,却未充分理解其对底层推理分布的影响。在本文中,我们从随机轨迹视角研究后训练推理。遵循 Kim 等(2025)的方法,我们将推理难度不同的步骤建模为具有不同概率的马尔可夫转移,并使用树结构马尔可夫链正式化推理过程。在此框架下,预训练对应于发现推理结构,而后训练主要是重新加权现有思考链。我们表明,RLVR 和推理时奖励聚合会将概率质量集中在少数高概率轨迹上,导致稀有但关键推理路径的抑制。因此,解决困难实例往往依赖底层模型中已存在的低概率轨迹。我们进一步证明,探索性机制,如拒绝容易实例和应用 KL 正则化,有助于保留这些稀有轨迹。实证仿真支持我们的理论分析。

关键词

引用

@article{arxiv.2511.07368,
  title  = {Post-Training as Reweighting: A Stochastic View of Reasoning Trajectories in Language Models},
  author = {Dake Bu and Wei Huang and Andi Han and Atsushi Nitanda and Bo Xue and Qingfu Zhang and Hau-San Wong and Taiji Suzuki},
  journal= {arXiv preprint arXiv:2511.07368},
  year   = {2026}
}