中文

面向深度选项学习的上下文特定表示抽象

机器学习 2022-04-26 v2 人工智能

摘要

分层强化学习致力于发现时间上扩展的动作(如选项),以在需要大量探索的问题中提供益处。选项批判(OC)框架是一种端到端学习这些选项的有前景的方法。我们在本文中考察并表明,OC并未将问题分解为更简单的子问题,而是通过每个选项在学习的整个状态空间中进行考虑,增大了策略空间上的搜索规模。该问题会导致此方法的实际局限,包括采样低效的学习。为解决该问题,我们提出面向深度选项学习的上下文特定表示抽象(CRADOL),这一新框架同时考虑时间抽象与上下文特定表示抽象,以有效缩减策略空间上的搜索规模。具体而言,我们的方法学习一种因子化信念状态表示,使每个选项仅能在状态空间的子段上学习策略。我们在分层、非分层及模块化循环神经网络基线上测试了方法,在具有挑战性的部分可观测环境中展现出显著的采样效率提升。

关键词

引用

@article{arxiv.2109.09876,
  title  = {Context-Specific Representation Abstraction for Deep Option Learning},
  author = {Marwa Abdulhai and Dong-Ki Kim and Matthew Riemer and Miao Liu and Gerald Tesauro and Jonathan P. How},
  journal= {arXiv preprint arXiv:2109.09876},
  year   = {2022}
}

备注

Accepted at AAAI 2022