质量-多样性演员-评论家:通过价值与后继特征评论家学习高性能与多样行为
机器学习
2024-06-04 v3 人工智能
摘要
智能的一个关键方面是能够为适应突发情况 demonstrate a broad spectrum of behaviors。过去十年,深度强化学习的进展导致了解决复杂连续控制任务的突破性成就。然而,大多数方法只返回为特定问题专门化的唯一解决方案。我们引入质量-多样性演员-评论家(QDAC),这是一种基于价值函数评论家和后继特征评论家的离策略演员-评论家深度强化学习算法,用于学习高性能与多样行为。在此框架下,演员优化目标 seamless 地统一两个评论家,通过受约束优化实现 (1) 最大化回报,同时 (2) 执行多样技能。与其他质量-多样性方法相比,QDAC 在六个具有挑战性的连续控制 locomotion 任务上实现了显著更高的性能和更具多样性的行为。我们还展示了可以利用所学技能比其他基线在五个扰动环境中更好地适应。最终,定性分析展示了一系列惊人之举:adaptive-intelligent-robotics.github.io/QDAC。
引用
@article{arxiv.2403.09930,
title = {Quality-Diversity Actor-Critic: Learning High-Performing and Diverse Behaviors via Value and Successor Features Critics},
author = {Luca Grillotti and Maxence Faldor and Borja G. León and Antoine Cully},
journal= {arXiv preprint arXiv:2403.09930},
year = {2024}
}
备注
The first two authors contributed equally to this work. Accepted at ICML 2024