基于学习奖励函数的挖掘机操作员自动评估
机器人学
2022-11-16 v1 人工智能
机器学习
摘要
训练新手操作挖掘机以学习不同技能需要专家教师的参与。考虑到问题的复杂性,寻找熟练专家相对昂贵,因为该过程耗时且需要高度专注。此外,由于人类往往存在偏见,评估过程含有噪声,并会导致具有相似技能的不同操作员最终得分出现高方差。本工作中,我们解决这些问题并提出了一种用于挖掘机操作员自动评估的新策略。我们在每个时间步考虑挖掘机的内部动力学与安全准则来评估表现。为进一步验证我们的方法,我们将该得分预测模型用作强化学习智能体的奖励来源,以在紧密复现真实世界动力学的仿真环境中学习操控挖掘机的任务。对于使用这些外部奖励预测模型所学习的策略,我们的结果表明,与仅用基于任务的奖励函数训练的策略相比,其解更安全且遵循所需的动力学约束,使其更接近于实际部署。为未来研究,我们在 https://github.com/pranavAL/InvRL_Auto-Evaluate 发布了代码库,并在 https://drive.google.com/file/d/1jR1otOAu8zrY8mkhUOUZW9jkBOAKK71Z/view?usp=share_link 发布了视频结果。
引用
@article{arxiv.2211.07941,
title = {Automatic Evaluation of Excavator Operators using Learned Reward Functions},
author = {Pranav Agarwal and Marek Teichmann and Sheldon Andrews and Samira Ebrahimi Kahou},
journal= {arXiv preprint arXiv:2211.07941},
year = {2022}
}
备注
11 pages, 5 figures, Accepted at Reinforcement Learning for Real Life (RL4RealLife) Workshop at NeurIPS 2022