中文

像素基的层次化策略对任务泛化的优势

机器学习 2024-07-30 v1 人工智能 机器人学

摘要

强化学习实践者通常避免在基于像素的观察空间中使用层次化策略。通常,相较于平坦策略,单任务性能提升并不足以弥补实现层次化所需的额外复杂性。然而,通过引入多个决策层次,层次化策略可以组合底层策略,从而更有效地实现任务之间的泛化,这凸显了多任务评估的必要性。我们通过从像素进行的模拟多任务机器人控制实验分析层次化策略的优势。我们的结果表明,采用任务条件训练的层次化策略能够 (1)提高训练任务上的性能, (2)在类似任务中实现更好的奖励和状态空间泛化, (3)降低解决新任务所需的微调复杂度。因此,我们认为,在构建能够实现任务间泛化的强化学习架构时,应考虑层次化策略。

关键词

引用

@article{arxiv.2407.19142,
  title  = {On the benefits of pixel-based hierarchical policies for task generalization},
  author = {Tudor Cristea-Platon and Bogdan Mazoure and Josh Susskind and Walter Talbott},
  journal= {arXiv preprint arXiv:2407.19142},
  year   = {2024}
}