L-SA:在多目标强化学习中学习未被充分探索的目标
机器学习
2023-05-24 v1 人工智能
摘要
涉及与各种目标交互的任务被称为多目标任务。当将通用强化学习方法应用于此类任务时,某些难以触及或交互的目标可能在整个训练过程中被忽视——我们将这一困境称为未被充分探索目标问题(UTP)。为解决该问题,我们提出了包含自适应采样与主动查询的 L-SA(通过自适应采样与主动查询学习)框架。在 L-SA 框架中,自适应采样以高比例动态采样成功率提升最大的目标,从而实现从易到难目标的课程式学习。主动查询促使智能体更频繁地与需要更多经验或探索的未被充分探索目标交互。我们在视觉导航任务上的实验结果表明,L-SA 框架提升了样本效率以及在具有 UTP 的各类多目标任务上的成功率。此外,实验证明自适应采样与主动查询之间的循环关系有效提升了未被充分探索目标的样本丰富度并缓解了 UTP。
引用
@article{arxiv.2305.13741,
title = {L-SA: Learning Under-Explored Targets in Multi-Target Reinforcement Learning},
author = {Kibeom Kim and Hyundo Lee and Min Whoo Lee and Moonheon Lee and Minsu Lee and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2305.13741},
year = {2023}
}
备注
17 pages include appendices, it is under-review