ShiQ:将 Bellman 方程重新引入大语言模型
机器学习
2025-05-19 v1
摘要
使用强化学习对预训练的大语言模型(LLM)进行微调通常被形式化为直接的政策优化。这种方法自然受到青睐,因为它有效地改进了作为初始政策的预训练 LLM。另一种 RL 方法——Q 学习——在 LLM 社区中受到的关注相对有限,尽管在各种非 LLM RL 任务中取得了显著成功。特别是,Q 学习的有效性来自其样本效率以及能够离线学习的能力,这在 LLM 采样成本高昂的背景下尤为珍贵。然而, naively 将 Q 学习风格的更新应用于模型的 logits 由于 LLM 的特殊性而无效。我们的核心贡献是从 Bellman 方程推导出理论上有据可依的损失函数,以适应 Q 学习方法用于 LLM。为此,我们仔细地将 RL 文献中的见解调整以考虑 LLM 特有的特征,确保 logits 成为可靠的 Q 值估计。我们随后使用该损失构建了一个实用的算法 ShiQ(Shifted-Q),支持离策略、token 级学习,同时保持简单易实现。最后,我们在合成数据和真实世界基准(如 UltraFeedback 和 BFCL-V3)上评估了 ShiQ,展示了其在单轮和多轮 LLM 设置中的有效性。
引用
@article{arxiv.2505.11081,
title = {ShiQ: Bringing back Bellman to LLMs},
author = {Pierre Clavier and Nathan Grinsztajn and Raphael Avalos and Yannis Flet-Berliac and Irem Ergun and Omar D. Domingues and Eugene Tarassov and Olivier Pietquin and Pierre H. Richemond and Florian Strub and Matthieu Geist},
journal= {arXiv preprint arXiv:2505.11081},
year = {2025}
}