基于奖励时间估计的通用元启发式方法用于大规模黑箱优化
神经与进化计算
2019-09-19 v2 人工智能
摘要
启发式优化器的泛化能力可能随搜索空间维度的增加而退化。为在大规模黑箱优化(LSBO)任务上实现泛化性能,可以集成若干启发式方法并设计元启发式来控制其启动。本文首先提出一种将LSBO问题转化为在线决策过程以最大化资源利用效率的方法论。随后,利用具有非平稳奖励分布的多臂老虎机视角,我们提出一种基于奖励时间估计(TER)的元启发式来解决此类决策过程。TER使用窗口进行时间信用分配,并采用Boltzmann探索以平衡探索-利用权衡。无先验的TER可跨LSBO任务泛化,并能灵活适应不同类型受限计算资源(如时间、资金等),且因其简洁性及便于启发式表达的接口而易适配新任务。在基准上的测试验证了问题表述并显示出显著有效性:当TER与三种启发式结合时,在搜索维度高达10000的不同基准问题集上均报告了具竞争力的性能。
引用
@article{arxiv.1812.06585,
title = {Generalizable Meta-Heuristic based on Temporal Estimation of Rewards for Large Scale Blackbox Optimization},
author = {Mingde Zhao and Hongwei Ge and Yi Lian and Kai Zhang},
journal= {arXiv preprint arXiv:1812.06585},
year = {2019}
}
备注
7 pages of contents, 1 page of references, 2 pages for appendix