中文

基于 ADHDP 的强化学习损失景观可视化框架:一个案例研究

机器学习 2026-03-17 v1 人工智能 机器人学

摘要

强化学习算法在动态和控制系统中得到广泛应用,但解释其内部学习行为仍是一大挑战。在作者之前的工作中,提出了一种用于研究 critic 训练的损失景观可视化方法。本研究将该方法扩展为一个提供多视角学习动力学视图的框架,阐明价值估计、策略优化与时序差 (TD) 信号在训练期间如何相互作用。该框架包括四个互补组成部分:对 critic match 损失表面的三维重建,揭示 TD 目标如何塑造优化几何;在冻结 critic 条件下的 actor 损失景观,揭示策略如何利用该几何;结合时间、贝尔曼误差与策略权重的轨迹,指示更新如何穿越表面;以及状态-TD 图,识别驱动这些更新的状态区域。用于航天姿态控制的 Action-Dependent Heuristic Dynamic Programming (ADHDP) 算法作为案例研究。该框架用于比较多种 ADHDP 变体,展示训练稳定器和目标更新如何改变优化景观并影响学习稳定性。因此,所提出的框架为分析不同算法设计中的强化学习行为提供了一个系统且可解释的工具。

关键词

引用

@article{arxiv.2603.14600,
  title  = {A Loss Landscape Visualization Framework for Interpreting Reinforcement Learning: An ADHDP Case Study},
  author = {Jingyi Liu and Jian Guo and Eberhard Gill},
  journal= {arXiv preprint arXiv:2603.14600},
  year   = {2026}
}

备注

Submitted to Acta Astronautica