可视化强化学习控制算法中评论家匹配损失景观的解释
机器学习
2026-05-05 v2 人工智能
机器人学
摘要
强化学习在多种情况下证明了其强大能力。然而,当系统动力学发生变化时,其性能并不总是得到保证,主要依赖于用户的经验。对于具有演员-评论家结构的强化学习算法,评论家神经网络反映了RL算法中的逼近与优化过程。分析评论家神经网络的性能有助于理解该算法的机制。为支持动态控制问题中此类算法的系统性解释,本工作提出了一种用于在线强化学习的评论家匹配损失景观可视化方法。该方法通过将记录的评论家参数轨迹投影到低维线性子空间上构建损失景观。使用固定参考状态样本和时序差目标在投影参数网格上评估评论家匹配损失。这产生一个三维损失表面,以及描述评论家学习行为的二维优化路径。为扩展分析,超出视觉检查,本文引入了量化景观指数和归一化系统性能指数,使不同训练结果的比较具有结构化特征。该方法使用Action-Dependent Heuristic Dynamic Programming算法在摆动物体和航天姿态控制任务上进行演示。跨投影方法和训练阶段的比较分析揭示了与稳定收敛和不稳定学习相关的不同景观特征。该方法框架使在线强化学习中评论家优化行为的定性和定量解释成为可能。
引用
@article{arxiv.2603.14535,
title = {Visualizing Critic Match Loss Landscapes for Interpretation of Online Reinforcement Learning Control Algorithms},
author = {Jingyi Liu and Jian Guo and Eberhard Gill},
journal= {arXiv preprint arXiv:2603.14535},
year = {2026}
}
备注
Published in Acta Astronautica, Vol. 246, pp. 909-920, 2026. DOI:10.1016/j.actaastro.2026.04.045