基于强化学习的挖掘机抓石头方法:引入引导型奖励函数
机器人学
2025-10-20 v2 系统与控制
系统与控制
摘要
使用标准挖掘机铲子抓取岩石是一项具有挑战性的任务,通常需要经验丰富的操作员的专业技能。与掘土不同,抓取岩石涉及操作大型不规则石头,这些石头在非结构化环境中,由于与颗粒材料的复杂接触相互作用,使得基于模型的控制方法难以实施。现有的自主挖掘方法主要针对连续介质,或依赖专用抓手,限制了其在现实施工现场的适用性。本文引入了一个完全数据驱动的岩石抓取控制框架,无需显式建模岩石或土壤属性。我们在AGX Dynamics仿真器中使用近端策略优化(PPO)算法及引导型奖励函数训练一个无模型的强化学习智能体。该学习到的策略直接输出用于CAT365挖掘机模型的臂、臂和铲的关节速度命令。通过对岩石几何形状、密度、质量以及铲子、岩石和目标位置的初始配置进行大量域随机化,显著提升了鲁棒性。据我们所知,这是首个开发和评估基于强化学习控制器用于岩石抓取任务的研究。实验结果表明,该策略对未见过的岩石和变化的土壤条件具有良好的推广能力,成功率与人类参与者相当,同时保持了机器的稳定性。这些发现表明,无需专用硬件或详细材料模型,基于学习的挖掘策略可用于离散物体操控,具有可行性。
引用
@article{arxiv.2510.04168,
title = {Learning to Capture Rocks using an Excavator: A Reinforcement Learning Approach with Guiding Reward Formulation},
author = {Amirmasoud Molaei and Mohammad Heravi and Reza Ghabcheloo},
journal= {arXiv preprint arXiv:2510.04168},
year = {2025}
}