中文

策略梯度控制中的算法相对轨迹估值

机器学习 2025-11-12 v1 系统与控制 系统与控制

摘要

我们研究了在策略梯度控制中轨迹价值如何依赖于学习算法。在不确定线性二次型调节器中使用轨迹沙普利值,我们发现激励持续性(PE)与原始REINFORCE算法下的边际价值之间存在负相关(r≈-0.38)。我们证明了一个方差介导的机制:(i) 对于固定能量,较高的PE产生较低的梯度方差;(ii) 在鞍点附近,较高的方差增加了逃逸概率,从而提高了边际贡献。当进行稳定化处理(状态白化或Fisher预条件)时,这个方差通道被中和,信息内容占据主导地位,使相关性变为正相关(r≈+0.29)。因此,轨迹价值是算法相对的。实验验证了这一机制,并表明决策对齐分数(留一法)在剪枝方面补充了沙普利值,而沙普利值则能识别出有害子集。

关键词

引用

@article{arxiv.2511.07878,
  title  = {Algorithm-Relative Trajectory Valuation in Policy Gradient Control},
  author = {Shihao Li and Jiachen Li and Jiamin Xu and Christopher Martin and Wei Li and Dongmei Chen},
  journal= {arXiv preprint arXiv:2511.07878},
  year   = {2025}
}