中文

截断在基于代价函数直接梯度下降的神经控制及自适应动态规划中的重要性

机器学习 2013-02-25 v1

摘要

在自适应动态规划、神经控制和强化学习中,目标是让智能体学习选择动作以最小化总成本函数。本文表明,当使用离散时间对智能体的运动进行建模时,在轨迹的最终时间步对智能体的运动进行“截断”可能非常重要。截断是指轨迹的最终时间步被截断,使得智能体恰好停在到达的第一个终止状态,不再移动更远。我们证明,当省略截断时,学习性能可能无法达到最优;而当正确进行截断时,学习性能可以显著提高。我们描述的截断问题影响那些使用环境模型函数的显式导数来计算学习梯度的算法。这些包括用于控制的随时间反向传播(BPTT)以及基于对偶启发式动态规划的方法。然而,截断问题不会显著影响基于启发式动态规划、时间差分或策略梯度学习算法的方法。类似地,截断问题不影响固定长度的有限时域问题。

关键词

引用

@article{arxiv.1302.5565,
  title  = {The Importance of Clipping in Neurocontrol by Direct Gradient Descent on the Cost-to-Go Function and in Adaptive Dynamic Programming},
  author = {Michael Fairbank},
  journal= {arXiv preprint arXiv:1302.5565},
  year   = {2013}
}