强化学习策略作为宏调节器而非宏布局器
机器学习
2024-12-11 v1 人工智能
摘要
在现代芯片设计中,布局旨在放置数百万个电路模块,这是显著影响功耗、性能和面积(PPA)指标的关键步骤。最近,强化学习(RL)作为一种有前景的技术出现,用于提升布局质量,尤其是宏布局。然而,当前基于 RL 的布局方法存在训练时间长、泛化能力差以及无法保证 PPA 结果的问题。一个关键问题在于问题 formulation,即从头使用 RL 进行布局,这导致训练过程中可用信息有限且奖励不准确。在本工作中,我们提出一种利用 RL 进行精化阶段的方法,使 RL 策略能够学习如何调整现有布局,从而为策略提供足够的信息来行动并获得相对稠密和精确的奖励。此外,我们在训练中引入了规则性概念,这被认为是芯片设计行业中的重要指标,但在当前的 RL 布局方法中常被忽视。我们在 ISPD 2005 和 ICCAD 2015 基准上评估了我们的方法,将我们提出的方法的全局半周长线长和规则性与几种竞争方法进行了比较。此外,我们使用商业软件测试了 PPA 性能,表明 RL 作为调节器可以实现显著的 PPA 改进。我们的 RL 调节器可以精化任何方法的布局并提升其质量。我们的工作为 RL 在布局中的应用开辟了新的可能性,提供了一种更有效和更高效的方法来优化芯片设计。我们的代码可在 \url{https://github.com/lamda-bbo/macro-regulator} 获取。
引用
@article{arxiv.2412.07167,
title = {Reinforcement Learning Policy as Macro Regulator Rather than Macro Placer},
author = {Ke Xue and Ruo-Tong Chen and Xi Lin and Yunqi Shi and Shixiong Kai and Siyuan Xu and Chao Qian},
journal= {arXiv preprint arXiv:2412.07167},
year = {2024}
}
备注
NeurIPS 2024