中文

将批判匹配损失景观可视化适用于离策略强化学习

机器学习 2026-03-17 v1 人工智能 机器人学

摘要

本工作将已建立的批判匹配损失景观可视化方法从在线强化学习扩展到离策略强化学习(RL),旨在揭示批判学习背后的优化几何。离策略RL与逐步在线演员-评论家学习在其回放式数据流和目标计算方面存在差异。基于这两个结构差异,批判匹配损失景观可视化方法被适配到Soft Actor-Critic(SAC)算法中,通过对齐损失评估以匹配其批处理数据流和目标计算,使用固定回放批次和来自所选策略的预计算评论家目标。期间记录的批判参数投影到主成分平面上,在该平面上评估批判匹配损失,以形成3维景观,叠加2维优化路径。应用于航天姿态控制问题时,对结果景观进行定性和定量分析,使用锐度、盆地面积和局部各向异性指标,以及时序景观快照。对比收敛型SAC、发散型SAC和发散型Action-Dependent Heuristic Dynamic Programming(ADHDP)案例,揭示了不同算法结构下distinct几何模式和优化行为。结果表明,适配的批判匹配损失可视化框架可作为分析离策略基于回放的RL控制问题中批判优化动力学的几何诊断工具。

关键词

引用

@article{arxiv.2603.14589,
  title  = {Adapting Critic Match Loss Landscape Visualization to Off-policy Reinforcement Learning},
  author = {Jingyi Liu and Jian Guo and Eberhard Gill},
  journal= {arXiv preprint arXiv:2603.14589},
  year   = {2026}
}

备注

Revised manuscript, submitted to Astrodynamics