稀疏奖励环境下异构强化学习智能体的协作训练:共享什么与何时共享?
机器学习
2022-02-25 v1 人工智能
摘要
在人类生命的早期阶段,婴儿通过受内在满足而非环境外在奖励驱动探索不同场景来发展技能。这种行为被称为内在动机,已成为解决稀疏奖励强化学习环境所带来探索挑战的一种方案。人们提出了多种探索方法,以加速同质智能体单智能体与多智能体问题的学习过程。然而,鲜有研究阐述部署于同一环境但与其不同实例交互且没有任何先验知识的异构智能体之间的协作学习框架。除异构性外,每个智能体的特性仅能访问完整状态空间的子集,这可能隐藏不同的探索策略与最优解。本文中我们结合内在动机与迁移学习的思想。具体而言,我们聚焦于在 actor-critic 模型架构中共享参数,并将通过内在动机获得的信息相结合,以期实现更高效的探索与更快的学习。我们通过在修改后的 ViZDoom 的 My Way Home 场景上进行的实验来测试我们的策略,该场景比原版更具挑战性且允许评估智能体间的异构性。我们的结果揭示了计算成本极小的协作框架可以胜过无知识共享的独立学习过程的不同方式。此外,我们指出需要正确调节外在与内在奖励之间的重要性,以避免不期望的智能体行为。
引用
@article{arxiv.2202.12174,
title = {Collaborative Training of Heterogeneous Reinforcement Learning Agents in Environments with Sparse Rewards: What and When to Share?},
author = {Alain Andres and Esther Villar-Rodriguez and Javier Del Ser},
journal= {arXiv preprint arXiv:2202.12174},
year = {2022}
}
备注
27 pages, 16 figures, 3 tables, under review