中文

面向双层强化学习的 Hessian-Free Actor-Critic 算法及其在 LLM 微调中的应用

机器学习 2026-04-23 v6 最优化与控制

摘要

我们研究一个结构化的双层优化问题:上层目标是光滑函数,下层问题是在马尔可夫决策过程 (MDP) 中的策略优化。上层决策变量参数化下层 MDP 的奖励,上层目标依赖于由该 MDP 诱导的最优策略。现有方法要求二阶信息、在下层施加强正则化,或通过嵌套循环程序低效使用样本。本文提出一种单循环、一阶 actor-critic 算法,通过惩罚-based 重构来优化双层目标。我们在下层 RL 目标中引入衰减熵正则化,以实现无偏的上层超梯度估计,无需精确求解未正则化的 RL 问题。我们通过一种新颖的下层残差分析,在特殊类型的 Polyak-Lojasiewicz 条件下,建立了所提出算法收敛于原始未正则化双层优化问题的有限时间和有限样本收敛性。我们通过网格世界目标位置问题以及通过强化学习从人类反馈 (RLHF) 实现的快乐推文生成进行实验验证。

关键词

引用

@article{arxiv.2601.16399,
  title  = {A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning},
  author = {Sihan Zeng and Sujay Bhatt and Sumitra Ganesh and Alec Koppel},
  journal= {arXiv preprint arXiv:2601.16399},
  year   = {2026}
}