中文

用于策略分解的稀疏性诱导表示

系统与控制 2022-09-16 v1 机器人学 系统与控制

摘要

策略分解(PoDec)是一种在推导最优控制问题策略时缓解维数灾难的框架。对于给定的系统表示(即描述系统的状态变量与控制输入),PoDec生成策略以对所有控制输入的策略进行联合优化的分解。由此,不同输入的策略以解耦或级联方式、作为状态变量某些子集的函数被推导,从而降低计算量。然而,系统表示的选择至关重要,因其决定了所得策略的次优性。我们提出一种启发式方法以寻找更易于分解的表示。我们的方法基于如下观察:每种分解都以最优性为代价在所得策略中强制一种稀疏模式,而本身已导致稀疏最优策略的表示可能产生具有更低次优性的分解。由于最优策略未知,我们构造一种使其LQR近似稀疏化的系统表示。对于一个简化双足机器人、一个4自由度机械臂和一架四旋翼飞行器,我们发现了相较原始PoDec所识别者能降低10%轨迹代价的分解。此外,分解策略产生的轨迹代价显著低于最先进强化学习算法所得策略。

关键词

引用

@article{arxiv.2209.07039,
  title  = {Sparsity Inducing Representations for Policy Decompositions},
  author = {Ashwin Khadke and Hartmut Geyer},
  journal= {arXiv preprint arXiv:2209.07039},
  year   = {2022}
}