通过迭代动作掩码学习高效强化学习机器人码垛任务规划器
机器人学
2024-04-09 v1
摘要
在物流场景中开发用于码垛的机器人系统至关重要,可满足供应链管理中对效率和精度的关键需求。本文研究了应用强化学习 (RL) 增强此类机器人系统的任务规划。面对巨大动作空间这一阻碍现成 RL 方法高效应用的重大挑战,本研究引入了一种利用监督学习迭代剪枝并有效管理动作空间的新方法。通过降低动作空间的复杂度,该方法不仅加速了学习阶段,还确保了机器人码垛任务规划的有效性与可靠性。实验结果突显了该方法的有效性,表明其在改善物流码垛等复杂高维环境中 RL 应用性能方面的潜力。
引用
@article{arxiv.2404.04772,
title = {Efficient Reinforcement Learning of Task Planners for Robotic Palletization through Iterative Action Masking Learning},
author = {Zheng Wu and Yichuan Li and Wei Zhan and Changliu Liu and Yun-Hui Liu and Masayoshi Tomizuka},
journal= {arXiv preprint arXiv:2404.04772},
year = {2024}
}
备注
8 pages, 8 figures