论区分后训练中的能力引导与能力创造:基于自由能的视角
人工智能
2026-05-12 v1 统计力学
机器学习
摘要
关于大型语言模型后训练的讨论常将监督微调(SFT)视为模仿,将强化学习(RL)视为发现。但这种区分过于粗糙。关键在于培训程序是否增加了预训练模型本已能够产生的行为概率,抑或是否改变了模型实际可达的行为。我们认为,后训练研究应区分能力引导与能力创造。我们通过引入可达支持的概念来实现该区分:即模型在有限预算下实际能产生的行为集合。后训练若对该支持内的行为进行重新加权,则为能力引导;若改变该支持本身,则为能力创造。我们通过自由能视角来阐述该论点。SFT 和 RL 都可视为对预训练参考分布进行重新加权,仅是外部信号不同。演示信号定义 SFT 的低能行为,奖励信号定义 RL 的低能行为。当更新保持接近基本模型时,主要效果是局部重新加权,而非能力创造。在此框架下,核心问题不再是后训练被表述为 SFT 还是 RL,而是它是否对已可达的行为进行重新加权,抑或是通过搜索、交互、工具使用或纳入新信息来扩大模型可达行为空间。
引用
@article{arxiv.2605.08368,
title = {On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective},
author = {Yuhao Li and Shengchao Liu},
journal= {arXiv preprint arXiv:2605.08368},
year = {2026}
}