用于黑盒优化基础模型的开源训练数据集
机器学习
2026-05-25 v1
摘要
大多数黑盒优化方法需要大量的超参数调优,这通常限制了它们在不同优化领域之间的泛化能力。从大量优化轨迹中学习优化原理的黑盒优化基础模型提供了一种有前景的替代方案,有望在多样化的问题类别中超越人工设计的方法。然而,先前的工作要么依赖于非公开数据集,要么依赖于纯合成数据,这限制了可复现性以及对现实世界问题的泛化能力。因此,由于缺乏大规模、真实世界、公开可用的预训练数据,该领域的进展受到了制约。我们引入了 BBO-Pile,这是第一个开源数据集,包含针对不同优化器在 3095 个不同黑盒上评估的超过 50 万条优化轨迹,是目前为止该任务最大的公开数据集。使用该数据集,我们训练了一系列多尺度的基础模型,参数量从 2M 到 80M,训练 token 数从 200M 到 2B,并研究了它们在计算量方面的缩放行为。我们的结果表明,大规模预训练是模仿黑盒优化方法的一种可行且有效的途径,为该方向的未来研究铺平了道路。
引用
@article{arxiv.2605.23417,
title = {An Open-Source Training Dataset for Foundation Models for Black-box Optimization},
author = {Aaron Klein and Herilalaina Rakotoarison and Luca Thale-Bombien and David Salinas},
journal= {arXiv preprint arXiv:2605.23417},
year = {2026}
}