K-Myriad:利用无监督并行智能体快速启动强化学习
机器学习
2026-01-27 v1
摘要
强化学习中的并行化通常用于加速单一策略的训练,其中多个工作线程从相同的采样分布中收集经验。这种常见设计忽略了多样化探索策略的优势,从而限制了并行化的潜力。我们提出了 K-Myriad,这是一种可扩展的无监督方法,可最大化由并行策略群体产生的集体状态熵。通过培育一组专门的探索策略,K-Myriad 为强化学习提供了稳健的初始化,不仅提高了训练效率,还能发现异构解。在大规模并行化下,在高维连续控制任务上的实验表明,K-Myriad 能够学习到广泛的不同策略,突显了其在集体探索方面的有效性,并为新颖的并行化策略铺平了道路。
引用
@article{arxiv.2601.18580,
title = {K-Myriad: Jump-starting reinforcement learning with unsupervised parallel agents},
author = {Vincenzo De Paola and Mirco Mutti and Riccardo Zamboni and Marcello Restelli},
journal= {arXiv preprint arXiv:2601.18580},
year = {2026}
}