中文

求解组合困难长视野深度强化学习任务的挑战

机器学习 2022-06-07 v1 人工智能 机器人学

摘要

深度强化学习在需要复杂推理的离散领域已展现出前景,包括国际象棋、围棋和 Hanabi 等游戏。然而,这类推理较少出现在具有高维观测的长视野连续领域中,而强化学习研究在该领域主要集中于具有简单高层结构的问题(例如打开抽屉或让机器人尽快移动)。受组合困难优化问题启发,我们提出一组机器人任务,这些任务在高层允许多种不同解,但需要推理数千步之后的状态和奖励以获得最佳性能。关键的是,尽管强化学习传统上因稀疏奖励而在复杂长视野任务上表现不佳,我们的任务经过精心设计可在无需专门探索的情况下求解。尽管如此,我们的研究发现标准 RL 方法常因折扣而忽略长期效应,而通用分层 RL 方法除非能利用额外的抽象领域知识否则举步维艰。

关键词

引用

@article{arxiv.2206.01812,
  title  = {Challenges to Solving Combinatorially Hard Long-Horizon Deep RL Tasks},
  author = {Andrew C. Li and Pashootan Vaezipoor and Rodrigo Toro Icarte and Sheila A. McIlraith},
  journal= {arXiv preprint arXiv:2206.01812},
  year   = {2022}
}