面向深度选项学习的上下文特定表示抽象
机器学习
2022-04-26 v2 人工智能
摘要
分层强化学习致力于发现时间上扩展的动作(如选项),以在需要大量探索的问题中提供益处。选项批判(OC)框架是一种端到端学习这些选项的有前景的方法。我们在本文中考察并表明,OC并未将问题分解为更简单的子问题,而是通过每个选项在学习的整个状态空间中进行考虑,增大了策略空间上的搜索规模。该问题会导致此方法的实际局限,包括采样低效的学习。为解决该问题,我们提出面向深度选项学习的上下文特定表示抽象(CRADOL),这一新框架同时考虑时间抽象与上下文特定表示抽象,以有效缩减策略空间上的搜索规模。具体而言,我们的方法学习一种因子化信念状态表示,使每个选项仅能在状态空间的子段上学习策略。我们在分层、非分层及模块化循环神经网络基线上测试了方法,在具有挑战性的部分可观测环境中展现出显著的采样效率提升。
引用
@article{arxiv.2109.09876,
title = {Context-Specific Representation Abstraction for Deep Option Learning},
author = {Marwa Abdulhai and Dong-Ki Kim and Matthew Riemer and Miao Liu and Gerald Tesauro and Jonathan P. How},
journal= {arXiv preprint arXiv:2109.09876},
year = {2022}
}
备注
Accepted at AAAI 2022