TuRTLe:面向RTL生成的LLM统一评估框架
硬件体系结构
2025-06-02 v2 人工智能
摘要
大型语言模型(LLM)的快速发展推动了生成式AI在多个领域的应用,包括电子设计自动化(EDA)。不同于传统软件开发,EDA具有独特挑战——生成的RTL代码必须在语法正确、功能准确的同时,还需被硬件综合工具实现且满足性能、功耗与面积约束。这些附加要求为现有代码生成基准所难以捕捉的复杂性,限制了其在RTL生成领域评估LLM效果的有效性。为此,本文提出TuRTLe,一个统一评估框架旨在系统性评估LLM在RTL生成关键任务中的表现。TuRTLe集成多种现有基准并自动化评估流程,实现对LLM在语法正确性、功能正确性、综合、PPA优化及逐行完成等方面的全面评估。通过该框架,我们对多样化开源LLM进行基准测试,分析其在EDA特定任务中的优势与不足。结果表明,基于推理的模型如DeepSeek R1在多项评估指标上一致领先,但需付出更高的计算开销与推理延迟。此外,基础模型在模块完成任务中表现更佳,而微调模型在从规范到RTL任务中表现更佳。
引用
@article{arxiv.2504.01986,
title = {TuRTLe: A Unified Evaluation of LLMs for RTL Generation},
author = {Dario Garcia-Gasulla and Gokcen Kestor and Emanuele Parisi and Miquel Albertí-Binimelis and Cristian Gutierrez and Razine Moundir Ghorab and Orlando Montenegro and Bernat Homs and Miquel Moreto},
journal= {arXiv preprint arXiv:2504.01986},
year = {2025}
}