关于大语言模型的混合在线强化与模仿学习:建模与算法
机器学习
2025-12-30 v1 人工智能
计算与语言
摘要
我们提出了一个用于大语言模型(LLM)微调的统一框架,该框架集成了模仿学习和强化学习。通过分析结合轨迹级 KL 散度与任务奖励的复合目标的梯度,我们推导出其向两个组件的自然分解:(1) 用于 token 级模仿的解析可计算稠密梯度,以及 (2) 用于长时序奖励优化的蒙特卡洛估计稀疏梯度。该稠密梯度具有闭式的 logit 级公式,可实现高效的 GPU 实现。
引用
@article{arxiv.2512.23097,
title = {A Note on Hybrid Online Reinforcement and Imitation Learning for LLMs: Formulations and Algorithms},
author = {Yingru Li and Ziniu Li and Jiacai Liu},
journal= {arXiv preprint arXiv:2512.23097},
year = {2025}
}