中文

生成器访问在自回归后训练中的作用

机器学习 2026-04-07 v1

摘要

我们研究了生成器访问如何约束自回归后训练。核心问题是学习者是否局限于从新根开始的 rollout,还是可以返回之前构建的前缀并查询该位置的下一个 token 规则。在根开始范式下,输出采样、生成 token 的对数概率、top-k 报告以及沿采样轨迹的完整下一个 token 分布都归结为一个标准实验,受限于到达有信息前缀的 on-policy 概率。弱前缀控制打破了这一障碍,一旦控制可用,更丰富的观察(如条件采样或 logits)即可超越 top-1 访问。仅改变生成器接口就会在 KL 正则化收益-奖励后训练中导致指数级差距。

关键词

引用

@article{arxiv.2604.04855,
  title  = {The Role of Generator Access in Autoregressive Post-Training},
  author = {Amit Kiran Rege},
  journal= {arXiv preprint arXiv:2604.04855},
  year   = {2026}
}

备注

Work in progress