中文

通过无监督质量-多样性方法克服适应性优化中的误导性问题

神经与进化计算 2025-04-07 v2 机器人学

摘要

策略优化寻求根据目标或适应度函数寻找控制问题的最佳解,作为工程与研究的基本领域,具有广泛的应用,尤其是在机器人领域。传统优化方法如强化学习和进化算法在面对误导性适应度景观时难以应对,即跟随即时改进会导致次优解。质量-多样性 (QD) 算法提供了一种可行的路径,通过维持 diverse 中间解作为逃离局部最优值的步柱。然而,QD 算法需要特定领域知识来定义手工特征,限制了其在难以表征解的多样性的领域的适用性。在本文中,我们表明无监督 QD 算法——具体而言是基于感官数据学习特征的 AURORA 框架——能够高效解决误导性优化问题,无需特定领域知识。通过增强 AURORA 引入对比学习和周期性灭绝事件,我们提出了 AURORA-XCon,其在所有传统优化基准上均表现出色,并且在某些情况下甚至比具有特定领域手工特征的最佳 QD 基准提高了最高可达 34%。本工作建立了无监督 QD 算法的新型应用,转变其从发现新解的焦点转向传统优化,从而扩大了其在定义特征空间具有挑战性的领域的潜在应用范围。

关键词

引用

@article{arxiv.2504.01915,
  title  = {Overcoming Deceptiveness in Fitness Optimization with Unsupervised Quality-Diversity},
  author = {Lisa Coiffard and Paul Templier and Antoine Cully},
  journal= {arXiv preprint arXiv:2504.01915},
  year   = {2025}
}