通过自动宏动作发现的分层元强化学习
机器学习
2024-12-17 v1 人工智能
摘要
元强化学习(Meta-RL)能够快速适应新的测试任务。尽管近期取得了进展,但在多个复杂高维任务中学习高性能策略仍然具有挑战性。为了解决这个问题,我们提出了一种新颖的三层分层架构,用于1)学习任务表示,2)以自动化方式发现任务无关的宏动作,3)学习原始动作。宏动作可以指导底层原始策略学习,更有效地过渡到目标状态。这可以解决策略在学习新的冲突任务时可能遗忘已学行为的问题。此外,通过从状态空间中移除任务特定组件,实现了宏动作的任务无关性。因此,这使得它们易于在不同任务间重新组合,并有望快速适应新任务。同时,我们创新的、独立定制的训练方案有效缓解了三层分层结构可能带来的不稳定性。在MetaWorld框架中的实验表明,与先前最先进的方法相比,我们的方法在样本效率和成功率上均有提升。
引用
@article{arxiv.2412.11930,
title = {Hierarchical Meta-Reinforcement Learning via Automated Macro-Action Discovery},
author = {Minjae Cho and Chuangchuang Sun},
journal= {arXiv preprint arXiv:2412.11930},
year = {2024}
}