利用潜动力学混合的虚构任务改进元强化学习泛化能力
机器学习
2022-01-19 v2
摘要
大多数元强化学习(meta-RL)方法的泛化能力在很大程度上局限于从用于采样训练任务同一分布中采样的测试任务。为克服该限制,我们提出潜动力学混合(LDM),其利用从所学潜动力学混合生成的虚构任务来训练强化学习智能体。通过在混合任务与原始训练任务上同时训练策略,LDM 使智能体在训练期间为未见测试任务做准备,并防止智能体过拟合训练任务。在网格世界导航和 MuJoCo 任务上,我们严格分离训练任务分布与测试任务分布,LDM 在测试回报上显著优于标准 meta-RL 方法。
引用
@article{arxiv.2105.13524,
title = {Improving Generalization in Meta-RL with Imaginary Tasks from Latent Dynamics Mixture},
author = {Suyoung Lee and Sae-Young Chung},
journal= {arXiv preprint arXiv:2105.13524},
year = {2022}
}
备注
NeurIPS 2021