EDA Corpus:一个用于增强与 OpenROAD 交互的大型语言模型数据集
计算与语言
2024-05-14 v1 人工智能
硬件体系结构
摘要
大型语言模型(LLMs)是强大的设计工具,能够实现任务自动化与设计辅助。近期进展已展现出将 LLM 集成到芯片设计流程的巨大潜力;然而,许多相关工作所依赖的数据并非公开可用,且/或未获得用于 LLM 训练与分发的宽松许可。本文提出一个解决方案,旨在通过引入一个为广泛采用的开源 EDA 工具链 OpenROAD 量身定制的开源数据集来弥合这一差距。该数据集包含超过 1000 个数据点,并以两种格式构建:(i) 由问题提示与散文式答案组成的配对集,以及 (ii) 由代码提示及其对应的 OpenROAD 脚本组成的配对集。通过提供此数据集,我们旨在促进 EDA 领域内以 LLM 为中心的研究。该数据集可在 https://github.com/OpenROAD-Assistant/EDA-Corpus 获取。
引用
@article{arxiv.2405.06676,
title = {EDA Corpus: A Large Language Model Dataset for Enhanced Interaction with OpenROAD},
author = {Bing-Yue Wu and Utsav Sharma and Sai Rahul Dhanvi Kankipati and Ajay Yadav and Bintu Kappil George and Sai Ritish Guntupalli and Austin Rovinski and Vidya A. Chhabria},
journal= {arXiv preprint arXiv:2405.06676},
year = {2024}
}
备注
Under review at Workshop on LLM-Aided Design (LAD'24)