中文

论区分后训练中的能力引导与能力创造:基于自由能的视角

人工智能 2026-05-12 v1 统计力学 机器学习

摘要

关于大型语言模型后训练的讨论常将监督微调(SFT)视为模仿,将强化学习(RL)视为发现。但这种区分过于粗糙。关键在于培训程序是否增加了预训练模型本已能够产生的行为概率,抑或是否改变了模型实际可达的行为。我们认为,后训练研究应区分能力引导与能力创造。我们通过引入可达支持的概念来实现该区分:即模型在有限预算下实际能产生的行为集合。后训练若对该支持内的行为进行重新加权,则为能力引导;若改变该支持本身,则为能力创造。我们通过自由能视角来阐述该论点。SFT 和 RL 都可视为对预训练参考分布进行重新加权,仅是外部信号不同。演示信号定义 SFT 的低能行为,奖励信号定义 RL 的低能行为。当更新保持接近基本模型时,主要效果是局部重新加权,而非能力创造。在此框架下,核心问题不再是后训练被表述为 SFT 还是 RL,而是它是否对已可达的行为进行重新加权,抑或是通过搜索、交互、工具使用或纳入新信息来扩大模型可达行为空间。

关键词

引用

@article{arxiv.2605.08368,
  title  = {On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective},
  author = {Yuhao Li and Shengchao Liu},
  journal= {arXiv preprint arXiv:2605.08368},
  year   = {2026}
}