ChipLingo:面向 EDA 领域大语言模型的系统化训练框架
机器学习
2026-05-01 v1
摘要
随着半导体技术的快速发展,电子设计自动化(EDA)已成为一个日益知识密集且文档驱动的工程领域。尽管大语言模型(LLM)展现出强大的通用能力,但由于领域专业知识有限、跨工具知识混淆以及领域训练后检索增强生成(RAG)性能下降,将其直接应用于 EDA 仍具挑战。为解决这些问题,本文提出 ChipLingo,一个为 EDA 场景量身定制的领域自适应 LLM 系统化训练流程。ChipLingo 包含三个阶段:通过多源数据整理和问答增强构建领域语料库,比较不同参数训练策略的领域自适应预训练,以及在多样化检索条件下进行 RAG 场景训练的指令对齐。我们还构建了一个内部基准 EDA-Bench,覆盖了代表性的 EDA 工具场景,并计划公开发布。实验表明,ChipLingo-8B 在 EDA-Bench 上达到 59.7% 的准确率,优于同规模基座模型和一些更大的通用模型。ChipLingo-32B 达到 70.02%,接近领先的闭源商业模型。进一步分析显示,问答增强提升了领域性能,部分微调(Partial FT)在适应性与通用能力保留之间取得了比 LoRA 更好的平衡,而显式的 RAG 场景训练缓解了领域训练后检索利用率的下降。这些结果证明了系统化领域训练对于知识密集型 EDA 任务的实用价值,并为未来的 EDA 智能体和外部知识驱动系统奠定了基础。
引用
@article{arxiv.2604.27415,
title = {ChipLingo: A Systematic Training Framework for Large Language Models in EDA},
author = {Lei Li and Xingwen Yu and Jianguo Ni and Junxuan Zhu and Jieqiong Zhang and Jian Zhao and Zhi Liu},
journal= {arXiv preprint arXiv:2604.27415},
year = {2026}
}