中文

基于 token 级自奖励的流式预测检索

机器学习 2025-03-04 v1 人工智能

摘要

仅依赖过去信息的自回归解码算法往往无法保证最佳性能。最近,人们发现利用外部奖励模型(RM)的提前查看算法(如蒙特卡洛树搜索,MCTS)可显著提高模型输出质量,通过允许模型提前思考并利用未来输出及其关联奖励来指导当前生成。此类技术可通过采样更优轨迹来帮助强化学习微调阶段,在推理阶段通过选择更好的输出来提高性能。然而,其高计算成本限制了在流式场景中的应用。为此,我们提出将 token 级自奖励建模(TRM)能力融入策略模型,以消除对外部模型和额外通信的需求。我们将新的架构称为奖励转换器(Reward Transformer)。此外,我们提出一种流式提前查看(SLA)算法以进一步提高搜索效率。实验表明,SLA 在三个通用领域数据集上相对于基线贪心解码算法以 79.7% 的总体胜率,同时保持流式效率。如果结合如 DPO 等强化学习微调技术,SLA 的总体胜率可达 89.4%。

关键词

引用

@article{arxiv.2503.00029,
  title  = {Streaming Looking Ahead with Token-level Self-reward},
  author = {Hongming Zhang and Ruixin Hong and Dong Yu},
  journal= {arXiv preprint arXiv:2503.00029},
  year   = {2025}
}