中文

基于白金汉 $\pi$ 定理的无量纲策略:这是一种推广数值结果的好方法吗?

最优化与控制 2024-03-01 v2 人工智能 机器人学 系统与控制 系统与控制

摘要

若上下文(定义运动控制问题的变量列表)在量纲上相似,则标题中所提问题的答案为“是”。本文探讨了使用白金汉 π\pi 定理作为一种工具,将物理系统的控制策略编码为可在多种情境中复用的更通用知识形式。该方法可解释为在学习控制策略的算法中强制基本单位缩放的不变性。首先,我们通过使用无量纲变量重述一个运动控制问题的解,表明(1)策略映射涉及更少参数,且(2)为特定系统数值生成的控制策略可通过适当缩放输入与输出变量,精确迁移至量纲相似系统的一个子集。随后,利用数值生成的最优控制器,针对扭矩受限倒立摆起摆与湿滑条件下车辆定位这两个经典运动控制问题,演示了这两个通用理论结果。我们还讨论了“ regime(区域)”的概念——即上下文变量空间中的一个区域——可帮助放宽相似性条件。此外,我们以线性二次型调节器(LQR)和计算力矩控制器为例,讨论了在某些条件下对特定上下文黑盒策略的输入输出进行量纲缩放,等价于在解析方程中代入新系统参数。该方法在推广更复杂高维问题的策略方面究竟有多实用尚待观察,但早期结果表明,对于动态规划和强化学习等数值方法而言,它是一个有前景的迁移学习工具。

关键词

引用

@article{arxiv.2307.15852,
  title  = {Dimensionless Policies based on the Buckingham $\pi$ Theorem: Is This a Good Way to Generalize Numerical Results?},
  author = {Alexandre Girard},
  journal= {arXiv preprint arXiv:2307.15852},
  year   = {2024}
}