多智能体强化学习中的无专家在线迁移学习
机器学习
2023-07-31 v3 人工智能
多智能体系统
摘要
强化学习(RL)中的迁移学习已被广泛研究,以通过引入利用外部知识增强训练阶段的方法,克服深度 RL 的训练问题,即探索代价、数据可用性与收敛时间。通常,知识从专家智能体迁移至新手。虽然这解决了新手智能体的问题,但此类迁移有效需要专家智能体对任务有良好理解。作为替代,本文提出无专家在线迁移学习(EF-OnTL),一种在多智能体系统中实现无专家实时动态迁移学习的算法。不存在专用专家,迁移源智能体与待迁移知识在每一步基于智能体性能与不确定性动态选择。为改进不确定性估计,我们还提出状态-动作-奖励-下一状态随机网络蒸馏(sars-RND),即 RND 的扩展,从 RL 智能体-环境交互中估计不确定性。我们在三个基准任务:Cart-Pole、基于网格的多队捕食者-猎物(mt-pp)和 Half Field Offense(HFO)上,针对无迁移场景及含与不含专家智能体的基于建议的基线,证明了 EF-OnTL 的有效性。结果表明,与不依赖任何外部输入或阈值调参的基于建议的基线相比,EF-OnTL 取得总体相当的性能。EF-OnTL 优于无迁移情形,且改进程度与所处理任务的复杂度相关。
引用
@article{arxiv.2303.01170,
title = {Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning},
author = {Alberto Castagna and Ivana Dusparic},
journal= {arXiv preprint arXiv:2303.01170},
year = {2023}
}