HyperPPO:一种用于寻找机器人控制小型策略的可扩展方法
机器人学
2023-09-29 v1 机器学习
摘要
对于内存受限且性能优异的机器人,其神经控制需要参数更少的模型。寻找这些更小的神经网络架构可能非常耗时。我们提出 HyperPPO,一种基于策略的强化学习算法,它利用图超网络同时估计多种神经网络架构的权重。我们的方法为远比常用网络小得多但仍编码高性能策略的网络估计权重。我们在保持样本效率的同时获得多个已训练策略,并为用户提供选择满足其计算约束的网络架构的自由。我们表明我们的方法具有良好的可扩展性——更多的训练资源可更快收敛到性能更高的架构。我们展示了由 HyperPPO 估计的神经策略能够对 Crazyflie2.1 四旋翼进行分散控制。网站:https://sites.google.com/usc.edu/hyperppo
引用
@article{arxiv.2309.16663,
title = {HyperPPO: A scalable method for finding small policies for robotic control},
author = {Shashank Hegde and Zhehui Huang and Gaurav S. Sukhatme},
journal= {arXiv preprint arXiv:2309.16663},
year = {2023}
}
备注
Website: https://sites.google.com/usc.edu/hyperppo