中文

受限 ML 部署优化中的可行性优先探索:面向崩溃型层次搜索空间

机器学习 2026-04-29 v1

摘要

在生产约束下部署机器学习模型需要在模型家族、量化方案、运行时后端和服务配置之间进行联合优化。这导致构成层次混合变量搜索空间,其中许多配置是无效的:评估可能崩溃、超出内存限制或违反延迟约束。标准黑箱优化器如树结构半参数估计器(TPE)和受限贝叶斯优化在有效配置常见时效果良好,但在敌对部署空间中会在无效或无信息试验中消耗大量小评估预算。本文研究该情形,询问优化是否应分为显式的探索阶段 followed by model-guided 的利用阶段。我们提出了热力预算退火(TBA),一种可行性优先的探索程序,在对 TPE 进行热启动前映射有效和可行区域。该方法包括针对敌对硬件的两种鲁棒机制:试验超时可提前中止明显不可行的评估,子空间黑名单在重复失败后暂时抑制类别子空间。我们还引入了 DeployBench—a 一个用于部署优化的基准套件,具有层次结构、隐藏崩溃区、硬约束和不等评估成本。在合成基准和实际 GPU 部署上(针对五个预训练视觉模型在五个 GPU 目标(NVIDIA H100、A100、RTX 5080、L4 和 T4)上的实验),该混合方法在紧张约束下改进了模型家族发现,同时减少了相对于 cold-start TPE 的预算消耗。

关键词

引用

@article{arxiv.2604.25073,
  title  = {Feasible-First Exploration for Constrained ML Deployment Optimization in Crash-Prone Hierarchical Search Spaces},
  author = {Christian Lysenstøen},
  journal= {arXiv preprint arXiv:2604.25073},
  year   = {2026}
}

备注

22 pages, 5 figures, 10 tables. Code available at https://github.com/Chrislysen/Constrained-ML-Deployment