半导体前端晶圆厂调度的强化学习方法可扩展性:与真实行业数据集的开源模型比较
人工智能
2025-07-30 v1 机器学习
神经与进化计算
摘要
基准数据集对于评估半导体行业调度或调度方法的开发和部署至关重要。然而,常用的基准数据集如Minifab或SMT2020缺乏真实场景中所见的复杂细节和约束。为缓解这一不足,我们比较了开源仿真模型与真实行业数据集,以评估优化方法在不同复杂度水平上的可扩展性。具体而言,我们聚焦于强化学习方法,基于策略梯度和演化策略进行优化。我们的研究提供了关于这些优化方法及其对真实半导体前端晶圆厂仿真模型的适用性的见解。我们表明,我们提出的基于演化策略的方法在可扩展性方面远优于相当于策略梯度的方法。此外,我们确定,通过代理控制相关瓶颈工具的选择和组合对于高效优化至关重要。对于不同装载情景和随机工具故障模式的泛化,我们在利用多样化训练数据集时取得优势。虽然总体方法计算成本较高,但它在用于训练的CPU核心数量方面扩展性良好。对于真实行业数据集,我们在延迟(tardiness)上实现了最高4%的改进,在吞吐量(throughput)上实现了最高1%的改进。对于较不复杂的开源模型Minifab和SMT2020,我们观察到在延迟上实现了十位数百分比的改进,在吞吐量上实现了个位数百分比的改进。
引用
@article{arxiv.2505.11135,
title = {Scalability of Reinforcement Learning Methods for Dispatching in Semiconductor Frontend Fabs: A Comparison of Open-Source Models with Real Industry Datasets},
author = {Patrick Stöckermann and Henning Südfeld and Alessandro Immordino and Thomas Altenmüller and Marc Wegmann and Martin Gebser and Konstantin Schekotihin and Georg Seidel and Chew Wye Chan and Fei Fei Zhang},
journal= {arXiv preprint arXiv:2505.11135},
year = {2025}
}