中文

VerifierQ:基于 Q 学习的 LLM 测试时间计算增强器

机器学习 2024-10-11 v1 计算与语言

摘要

最近的测试时间计算进展,特别是通过使用验证器模型,显著增强了大型语言模型(LLM)的推理能力。这种生成器-验证器方法类似于强化学习(RL)中的 actor-critic 框架。然而,当前的验证器模型 often 依赖于监督式微调,缺乏类似 Q 学习的数值差分学习。本文介绍了 VerifierQ,这是一种将离线 Q 学习集成到 LLM 验证器模型中的新方法。我们解决了将 Q 学习应用于 LLM 的三个关键挑战:(1)处理句子级马尔可夫决策过程(MDP),(2)管理大规模动作空间,(3)缓解高估偏差。VerifierQ 引入了用于有界 Q 值修改的贝尔曼更新,采用隐式 Q 学习(IQL)高效管理动作空间,并整合新颖的保守 Q 学习(CQL)公式以实现平衡的 Q 值估计。我们的方法实现了并行 Q 值计算,提高了训练效率。虽然最近的工作探索了类似蒙特卡洛树搜索(MCTS)的生成器技术,但 VerifierQ 是首次通过 Q 学习研究验证器(评论家)方面。将 RL 原则整合到验证器模型中补充了现有生成器技术的进展,可能使 LLM 在解决复杂认知任务方面更具鲁棒性和适应性。在数学推理任务上的实验结果表明,VerifierQ 的性能优于传统监督式微调方法,在效率、准确性和鲁棒性方面均有所提升。通过增强生成与评估能力之间的协同作用,VerifierQ 促进了 AI 系统在各类领域解决复杂认知任务的持续演进。

关键词

引用

@article{arxiv.2410.08048,
  title  = {VerifierQ: Enhancing LLM Test Time Compute with Q-Learning-based Verifiers},
  author = {Jianing Qi and Hao Tang and Zhigang Zhu},
  journal= {arXiv preprint arXiv:2410.08048},
  year   = {2024}
}