面向任意随机策略且具计算效率的限制归一化流设计
机器人学
2024-12-18 v1 机器学习
摘要
本文提出了一种使用归一化流 设计随机控制策略的新设计方法。在强化学习 (RL) 中,策略通常被建模为具有可训练参数的分布模型。当这种参数化表达能力较弱时,将无法获得最优策略。混合模型具有通用逼近能力,但其过多的冗余会增加计算成本,这在考虑实时机器人控制的应用时可能成为瓶颈。作为另一种方法,NF 通过附加参数实现从作为基础的简单随机模型进行可逆变换,有望发挥高表达能力并降低计算成本。然而,由于可逆变换的复杂性,NF 无法解析地计算其均值,并且由于在部署于机器人控制器后仍保留随机行为,因此缺乏可靠性。因此,本文设计了一种受限归一化流 (RNF),通过适当地限制可逆变换来实现解析均值。此外,使用双峰 student-t 分布作为其基础(称为 Bit-RNF)来恢复因这种限制而受损的表达能力。在 RL 基准测试中,Bit-RNF 策略优于以前的模型。最后,真实机器人实验证明了 Bit-RNF 策略在现实世界中的适用性。附带的视频已上传至 youtube:https://youtu.be/R_GJVZDW9bk
关键词
引用
@article{arxiv.2412.12894,
title = {Design of Restricted Normalizing Flow towards Arbitrary Stochastic Policy with Computational Efficiency},
author = {Taisuke Kobayashi and Takumi Aotani},
journal= {arXiv preprint arXiv:2412.12894},
year = {2024}
}
备注
27 pages, 13 figures