中文

无需目标网络的分布式价值估计用于鲁棒的质量-多样性

机器学习 2026-04-23 v1 神经与进化计算 机器人学

摘要

质量-多样性(QD)算法擅长发现多样化的技能库,但受限于低样本效率,通常需要数千万个环境步才能解决复杂的运动任务。强化学习(RL)的最新进展表明,高更新-数据比(UTD)可以加速Actor-Critic学习。虽然有效,但标准的高UTD算法通常利用目标网络来稳定训练。这一要求引入了显著的计算瓶颈,使其不适用于资源密集型且样本效率和种群快速适应至关重要的质量-多样性(QD)任务。在本文中,我们引入了QDHUAC,这是一种样本高效、无目标且分布式的QD-RL算法,它提供密集且低方差的梯度信号,从而能够为支配性新颖性搜索进行高UTD训练,同时所需的环境步数减少一个数量级。我们证明,我们的方法能够在高UTD比率下实现稳定训练,在Brax高维环境中以比基线少一个数量级的样本量实现了有竞争力的覆盖率和适应度。我们的结果表明,将无目标分布式评论家与基于支配的选择相结合,是下一代样本高效进化RL算法的关键推动因素。

关键词

引用

@article{arxiv.2604.20381,
  title  = {Distributional Value Estimation Without Target Networks for Robust Quality-Diversity},
  author = {Behrad Koohy and Jamie Bayne},
  journal= {arXiv preprint arXiv:2604.20381},
  year   = {2026}
}

备注

Accepted as Full Paper at GECCO'26