数据抽样记忆序列长度影响元强化学习智能体的适应性
机器学习
2024-06-19 v1 人工智能
摘要
快速适应新任务对于真实世界中的具身智能体至关重要。元强化学习(meta-RL)已成为一种有效的方法,使其能够在未知环境中实现快速适应。相较于基于策略的元强化学习算法,基于策略的算法高度依赖高效的数据抽样策略来提取和表示历史轨迹。然而,人们对不同数据抽样方法如何影响元强化学习智能体表示未知环境的能力了解不多。本文我们探讨了数据抽样策略对元强化学习智能体探索和适应能力的影响。具体而言,我们基于Thompson抽样和贝叶斯最优理论,在MuJoCo环境中的连续控制任务和稀疏奖励导航任务中进行了实验。我们的分析揭示了长记忆和短记忆序列抽样策略影响元强化学习智能体的表示和适应能力。我们发现基于贝叶斯最优理论的算法在基于Thompson抽样的算法中表现出更稳健和更好的适应性,这突显了合适的数据抽样策略对智能体对未知环境的表示尤其在稀疏奖励情况下至关重要。
关键词
引用
@article{arxiv.2406.12359,
title = {Memory Sequence Length of Data Sampling Impacts the Adaptation of Meta-Reinforcement Learning Agents},
author = {Menglong Zhang and Fuyuan Qian and Quanying Liu},
journal= {arXiv preprint arXiv:2406.12359},
year = {2024}
}