降低真实世界策略优化中周期时间调参的成本
机器学习
2023-06-02 v2 人工智能
机器人学
摘要
连续时间强化学习任务通常对动作采用固定周期时间的离散步。由于实践者需为给定任务选择动作周期时间,一个重大担忧是学习算法的超参数是否需要对每个周期时间选择重新调优,这对真实世界机器人而言难以承受。本工作中,我们考察了两种策略梯度算法——PPO 与 SAC——在不同周期时间下的广泛使用的基线超参数值。使用一个基线超参数对两算法均表现良好的基准任务,我们揭示当选择异于任务默认的周期时间时,带基线超参数的 PPO 无法学习。此外,带其基线超参数的 PPO 与 SAC 均明显劣于各自针对每周期时间调优的值。我们提出基于周期时间设置这些超参数的新方法。在模拟与真实世界机器人任务的实验中,所提方法至少与基线超参数表现相当,对大多数周期时间选择有显著更好表现,且未在任何周期时间下导致学习失败。超参数调优仍是真实世界机器人的重大障碍,因我们的方法在新任务上仍需一些初始调优,尽管相较于对每个周期时间广泛调优可忽略不计。我们的方法在给定任务改变周期时间后无需额外调优,是迈向避免真实世界策略优化中广泛且昂贵超参数调优的一步。
引用
@article{arxiv.2305.05760,
title = {Reducing the Cost of Cycle-Time Tuning for Real-World Policy Optimization},
author = {Homayoon Farrahi and A. Rupam Mahmood},
journal= {arXiv preprint arXiv:2305.05760},
year = {2023}
}
备注
To appear in Proceedings of the 2023 International Joint Conference on Neural Networks (IJCNN). Source code is available at http://github.com/homayoonfarrahi/cycle-time-study and companion video at http://www.youtube.com/watch?v=tmo5fWGRPtk