中文

作为强化学习智能体激励的状态表示:关于机器人抓取的仿真到现实分析

机器人学 2024-08-09 v3 人工智能

摘要

为强化学习智能体底层决策过程选择适当的环境表示并非总是直截了当。状态表示应足够包容以允许智能体基于信息充分决策其动作,且足够解耦以简化策略训练及相应的仿真到现实(sim2real)迁移。鉴于此观点,本工作考察了各种表示在激励智能体解决特定机器人任务(对映体与平面物体抓取)中的效果。定义了一组连续的状态表示,从手工设计的数值状态到编码的基于图像的表示,任务特定知识的诱导水平递减。考察了每种表示对智能体在仿真中解决任务能力及学习策略向真实机器人可迁移性的影响,并与具有完整系统知识的基于模型的方法进行比较。结果表明,使用数值状态的强化学习智能体表现可与无学习基线持平。此外,我们发现使用来自预训练环境嵌入向量的基于图像表示的智能体优于端到端训练的智能体,并假设将表示学习从强化学习中分离有益于sim2real迁移。最后,我们得出结论:以任务特定知识激励状态表示有助于智能体训练更快收敛并提高sim2real机器人控制中的成功率。

关键词

引用

@article{arxiv.2309.11984,
  title  = {State Representations as Incentives for Reinforcement Learning Agents: A Sim2Real Analysis on Robotic Grasping},
  author = {Panagiotis Petropoulakis and Ludwig Gräf and Mohammadhossein Malmir and Josip Josifovski and Alois Knoll},
  journal= {arXiv preprint arXiv:2309.11984},
  year   = {2024}
}

备注

Accepted to IEEE International Conference on Systems, Man, and Cybernetics (SMC) 2024