CQM:基于量化世界模型的课程强化学习
机器学习
2023-10-27 v1 人工智能
摘要
近期课程强化学习(RL)通过提出替代任务序列,在解决复杂任务方面显示出显著进展。然而,先前方法在高维空间中生成课程目标时常面临挑战,因而通常依赖人工指定的目标空间。为缓解此限制并提升课程的可扩展性,我们提出一种新颖课程方法,自动定义包含课程过程关键信息且在其上建议课程目标的语义目标空间。为定义语义目标空间,我们的方法通过向量量化变分自编码器(VQ-VAE)离散化连续观测,并通过图恢复离散化观测间的时序关系。同时,我们所提方法建议不确定性与时序距离感知的课程目标,其在自动构建的目标空间上收敛至最终目标。我们证明所提方法仅以原始目标样本即可在无知环境中高效探索。此外,在多种目标到达任务中,即使使用自我中心视觉输入,我们的方法在数据效率与性能上也优于最先进的课程 RL 方法。
引用
@article{arxiv.2310.17330,
title = {CQM: Curriculum Reinforcement Learning with a Quantized World Model},
author = {Seungjae Lee and Daesol Cho and Jonghae Park and H. Jin Kim},
journal= {arXiv preprint arXiv:2310.17330},
year = {2023}
}
备注
Accepted to NeurIPS 2023