面向离屏策略强化学习的低秩适配器用于批评家学习
机器学习
2026-05-08 v2 人工智能
摘要
扩大批评家容量是提高离屏策略强化学习 (RL) 的有前景的方向。然而,最近的工作表明,较大的批评家在基于回放的引导式训练中容易出现过拟合和不稳定。本文我们提出使用低秩适配器 (LoRA) 作为批评家学习的结构正则器。我们的方法冻结随机初始化的基矩阵,仅优化相应的低秩适配器,从而将批评家更新限制在低维子空间中。我们在包括基于不同网络结构的 SAC 和 FastTD3 等不同离屏 RL 算法上进行评估。经验上,LoRA 有效地在训练期降低批评家损失,并提高整体策略性能,在大多数任务中实现最佳或相当于基线的结果。广泛的实验表明,低秩更新为离屏强化学习中的批评家学习提供了一种简单且有效的结构正则化形式。
引用
@article{arxiv.2604.18978,
title = {Low-Rank Adaptation for Critic Learning in Off-Policy Reinforcement Learning},
author = {Yuan Zhuang and Yuexin Bian and Sihong He and Jie Feng and Qing Su and Songyang Han and Jonathan Petit and Shihao Ji and Yuanyuan Shi and Fei Miao},
journal= {arXiv preprint arXiv:2604.18978},
year = {2026}
}