大语言模型后训练:关于离策略与在策略学习的统一视角
计算与语言
2026-04-17 v2 人工智能
机器学习
摘要
后训练已成为将预训练的大语言模型 (LLM) 转化为对齐、具备能力且可部署系统的核心环节。近期进展涵盖监督微调 (SFT)、偏好优化、强化学习 (RL)、过程监督、验证器引导方法、蒸馏以及多阶段管道等。然而,这些方法往往以碎片化的方式讨论,按标签或目标组织,而非从解决行为瓶颈的角度组织。本文认为,LLM后训练应被视为对模型行为的结构化干预。我们首先按轨迹来源对领域进行组织,这定义了两个主要 regime:一种是基于外部提供的轨迹的离策略学习,另一种是基于学习者生成的 rollout 的在策略学习。随后,我们通过两种反复出现的角色进行方法解释——有效支持扩展,这使有用行为更易达成;策略重塑,这改进已可达区域内的行为——以及一种补充性的系统层面的角色,即行为Consolidation,这在各阶段和模型转换之间保留、传递和摊销有用行为。从而,SFT 可 serve 于支持扩展或策略重塑;偏好优化通常为离策略重塑,尽管在线变体更接近学习者生成的状态。在策略学习中,通常会改进学习者生成状态上的行为,但更强的指导也可能使难以到达的推理路径变得可达。蒸馏往往更可被理解为Consolidation而非仅仅压缩,混合管道则作为协调的多阶段组成物出现。总体而言,本框架有助于诊断后训练瓶颈,推理阶段组合,表明进展越来越取决于协调的系统设计,而非任何单一的主导目标。
引用
@article{arxiv.2604.07941,
title = {Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning},
author = {Shiwan Zhao and Zhihu Wang and Xuyang Zhao and Jiaming Zhou and Caiyue Xu and Chenfei Liu and Liting Zhang and Yuhang Jia and Yanzhe Zhang and Hualong Yu and Zichen Xu and Qicheng Li and Yong Qin},
journal= {arXiv preprint arXiv:2604.07941},
year = {2026}
}
备注
38 pages, 1 figure, 8 tables