通过证明 Transformer 在稀疏布尔函数上的学习能力,揭示 RL 与 SFT 的差异
机器学习
2026-05-27 v2 机器学习
摘要
Transformer 通过精细调优可获取链式思考(CoT)能力,以解决复杂推理任务。强化学习(RL)和监督式精细调优(SFT)是实现这一目标的两种主要方法。本文具体考察了带过程奖励的 RL 和 SFT 对于学习通过中间推理步骤类比 CoT 的单层 Transformer 所掌握的 稀疏布尔函数。特别是,我们考虑可递归分解为固定 2 稀疏布尔函数的 稀疏布尔函数。我们首先统一分析了带过程奖励的 RL 精细调优和 SFT 的学习动力学。这使我们能够识别 Transformer 在这些稀疏布尔函数上 provably 学习的充分条件。我们随后验证了这些条件对三个基本例子——-PARITY、-AND 和 -OR——是否成立,从而证明了通过 RL 和 SFT 均可实现学习。值得注意的是,我们发现 RL 和 SFT exhibits 不同的学习行为:RL 同时学习整个 CoT 链,而 SFT 自然地逐步学习 CoT 链。总体而言,我们的发现提供了理解 RL 和 SFT 背后机制的见解,揭示了它们在触发 Transformer CoT 能力方面的差异,并表明比较 RL 与 SFT 可能需要考虑奖励设计和教师强制的使用。
引用
@article{arxiv.2511.17852,
title = {Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently},
author = {Bochen Lyu and Yiyang Jia and Xiaohao Cai and Zhanxing Zhu},
journal= {arXiv preprint arXiv:2511.17852},
year = {2026}
}
备注
50 pages, 12 figures