中文

奖励移位推测采样:一种高效测试时弱到强的对齐方法

计算与语言 2025-09-24 v3

摘要

与人类偏好一致的大型语言模型(LLM)开发已成为关键步骤。近期研究越来越关注测试时对齐,即在推理期间分配额外计算资源以增强LLM的安全性和推理能力。然而,这些测试时对齐技术往往造成巨大的推理成本,限制了实际应用。我们受到推测采样加速方法的启发,该方法利用小型草稿模型高效预测未来标记,以解决测试时对齐的效率瓶颈。我们引入奖励移位推测采样(SSS)算法,其中草稿模型与人类偏好对齐,而目标模型保持不变。我们理论地表明,aligned草稿模型与未对齐目标模型之间的分布性移位可被利用,在不实际获取其RLHF最优解的情况下,通过修改接受准则和bonus标记分布来恢复RLHF最优解。我们的算法在测试时弱到强的对齐实验中以显著降低的推理成本实现了优异的金牌奖励分数,从而验证了其有效性和效率。

关键词

引用

@article{arxiv.2508.15044,
  title  = {Reward-Shifted Speculative Sampling Is An Efficient Test-Time Weak-to-Strong Aligner},
  author = {Bolian Li and Yanran Wu and Xinyu Luo and Ruqi Zhang},
  journal= {arXiv preprint arXiv:2508.15044},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference