生成器访问在自回归后训练中的作用
机器学习
2026-04-07 v1
摘要
我们研究了生成器访问如何约束自回归后训练。核心问题是学习者是否局限于从新根开始的 rollout,还是可以返回之前构建的前缀并查询该位置的下一个 token 规则。在根开始范式下,输出采样、生成 token 的对数概率、top-k 报告以及沿采样轨迹的完整下一个 token 分布都归结为一个标准实验,受限于到达有信息前缀的 on-policy 概率。弱前缀控制打破了这一障碍,一旦控制可用,更丰富的观察(如条件采样或 logits)即可超越 top-1 访问。仅改变生成器接口就会在 KL 正则化收益-奖励后训练中导致指数级差距。
引用
@article{arxiv.2604.04855,
title = {The Role of Generator Access in Autoregressive Post-Training},
author = {Amit Kiran Rege},
journal= {arXiv preprint arXiv:2604.04855},
year = {2026}
}
备注
Work in progress