中文

以相同努力获得更多学习:随机化如何提高机器人深度强化学习智能体的鲁棒性

机器人学 2025-01-27 v1 人工智能

摘要

深度强化学习(DRL)的工业应用经常因无法生成训练模型所需的经验而受到阻碍。收集数据通常需要相当的时间和经济成本,在大多数情况下难以承担。幸运的是,机器人等设备可以通过虚拟环境来获取合成经验,从而缓解了人工智能体的样本效率问题,但另一个问题随之而来:将合成经验有效地迁移到现实世界(仿真-现实)的需求。本文分析了一种最先进的仿真-现实技术,即渐进神经网络(PNNs)的鲁棒性,并研究在合成经验中引入多样性如何补充其作用。为了更好地理解导致鲁棒性不足的驱动因素,该机器人智能体仍在虚拟环境中进行测试,以确保模拟模型与真实模型之间的差异完全可控。结果表明,类似 PNN 的智能体在真实训练阶段初会出现显著的鲁棒性下降。在仿真训练期间对某些变量进行随机化可显著缓解此问题。平均而言,在训练过程中引入多样性后,模型准确率提高约 25%。这一改进可转化为在相同最终鲁棒性性能下所需的真实经验减少。尽管如此,无论虚拟经验的质量如何,向智能体添加真实经验仍然有益。

关键词

引用

@article{arxiv.2501.14443,
  title  = {Learning more with the same effort: how randomization improves the robustness of a robotic deep reinforcement learning agent},
  author = {Lucía Güitta-López and Jaime Boal and Álvaro J. López-López},
  journal= {arXiv preprint arXiv:2501.14443},
  year   = {2025}
}

备注

This article was accepted and published in Applied Intelligence (10.1007/s10489-022-04227-3)