SMAC:面向稳健离线到在线迁移的得分匹配演员-评论家
机器学习
2026-03-02 v2 人工智能
摘要
现代离线强化学习方法能够找到表现良好的演员-评论家网络,但这些演员-评论家网络在使用基于价值的强化学习算法进行在线微调时,通常会导致性能立即下降。我们提供的证据与假设一致:在损失景观中,离线算法所寻找的局部最大值与在线局部最大值之间被低性能谷底分隔,这些谷底是梯度基于微调所遍历的路径。基于此,我们提出了得分匹配演员-评论家 (Score Matched Actor-Critic, SMAC) 方法,旨在学习能够在离线阶段平滑迁移至在线价值强化学习算法的演员-评论家网络。SMAC 通过对 Q 函数进行正则化,确保策略得分与 Q 函数动作梯度之间的一阶导数相等,从而避免离线与在线最大值之间的谷底。我们在实验中表明,SMAC 能收敛至离线最大值,这些最大值通过单调递增奖励的路径与更好的在线最大值相连。SMAC 在 6/6 个 D4RL 任务中实现了对 Soft Actor-Critic 和 TD3 的平滑迁移。在 4/6 个环境中,它将后悔值降低了 34%~58%。
引用
@article{arxiv.2602.17632,
title = {SMAC: Score-Matched Actor-Critics for Robust Offline-to-Online Transfer},
author = {Nathan Samuel de Lara and Florian Shkurti},
journal= {arXiv preprint arXiv:2602.17632},
year = {2026}
}