少样本质量-多样性优化
机器学习
2024-01-22 v3 人工智能
神经与进化计算
摘要
过去几年中,大量研究致力于利用以往学习经验并设计少样本与元学习方法,其问题领域涵盖从计算机视觉到基于强化学习的控制。一个显著的例外——据我们所知,在该方向上几乎未付出努力——是质量-多样性(QD)优化。QD 方法已被证明是处理强化学习中欺骗性极小值与稀疏奖励的有效工具。然而,由于其依赖于固有样本低效的进化过程,它们仍然代价高昂。我们表明,给定任务分布中的若干示例,优化在参数空间中所经路径的信息可被用以构建先验种群;当该种群用于在未知环境中初始化 QD 方法时,可实现少样本适应。我们提出的方法不需要反向传播。它易于实现与扩展,且此外对正在训练的底层模型无关。在采用机器人操作与导航基准的稀疏与稠密奖励设定下进行的实验表明,它显著减少了这些环境中 QD 优化所需的代数。
引用
@article{arxiv.2109.06826,
title = {Few-shot Quality-Diversity Optimization},
author = {Achkan Salehi and Alexandre Coninx and Stephane Doncieux},
journal= {arXiv preprint arXiv:2109.06826},
year = {2024}
}
备注
Accepted for publication in the IEEE Robotics and Automation Letters (RA-L) journal