通过靶向多样性实现开放式模拟器中的自适应智能体训练
机器学习
2024-11-08 v1 人工智能
机器人学
机器学习
摘要
端到端学习方法在具身决策领域的广泛应用受到其对大量代表性训练数据依赖的瓶颈。元强化学习(元强化学习)方法放弃了标准强化学习(RL)的零样本泛化目标,转而支持少样本适应,因而在弥合更大的泛化差距方面具有前景。虽然学习这种元层级自适应行为仍需要大量数据,但逼近真实世界复杂性的高效环境模拟器正日益普及。然而,为这些复杂领域手工设计足够多样且数量充足的模拟训练任务是极其劳动密集型的。域随机化(DR)和程序化生成(PG)作为解决方案,要求模拟器具备能直接转化为有意义任务多样性的精心定义的参数——这是一个同样 prohibitive 的假设。在本工作中,我们提出了 DIVA,一种在复杂开放式模拟器中生成多样化训练任务的进化方法。与无监督环境设计(UED)方法类似,DIVA 可应用于任意参数化,但还能融入实际可用的领域知识——从而继承了 UED 的灵活性和通用性,以及 DR 和 PG 所利用的良好设计模拟器中嵌入的监督结构。我们的实验结果展示了 DIVA 克服复杂参数化并成功训练自适应智能体行为的独特能力,远优于先前文献中的竞争性基线。这些发现凸显了此类半监督环境设计(SSED)方法的潜力,DIVA 是其首个组成部分,可实现真实模拟域中的训练,并产生更鲁棒、更强大的自适应智能体。
引用
@article{arxiv.2411.04466,
title = {Enabling Adaptive Agent Training in Open-Ended Simulators by Targeting Diversity},
author = {Robby Costales and Stefanos Nikolaidis},
journal= {arXiv preprint arXiv:2411.04466},
year = {2024}
}
备注
NeurIPS 2024