RL自动环境塑造是下一站 frontier
机器人学
2024-07-24 v1 人工智能
机器学习
摘要
许多机器人学家梦想着在晚上给机器人一个任务,第二天天早上就能发现机器人能够解决该任务。我们又是什么阻碍了我们实现这一目标呢?仿真到现实的强化学习(RL)在具有挑战性的机器人任务上已经取得了令人印象深刻的性能,但需要大量的人力工作来设置一种对RL友好的任务。我们认为,政策优化等算法改进应该引向解决训练环境塑造的主要瓶颈,即设计观察、动作、奖励和仿真动力学。大多数实践者并不调整RL算法,而是调整其他环境参数以获得理想的控制器。我们认为,只有当社区专注于自动化环境塑造程序时,RL才能扩展到多样化的机器人任务。
引用
@article{arxiv.2407.16186,
title = {Automatic Environment Shaping is the Next Frontier in RL},
author = {Younghyo Park and Gabriel B. Margolis and Pulkit Agrawal},
journal= {arXiv preprint arXiv:2407.16186},
year = {2024}
}
备注
ICML 2024 Position Track; Website at https://auto-env-shaping.github.io/