CreativEval:评估基于大语言模型的硬件代码生成的创造力
计算与语言
2024-04-16 v1
摘要
大语言模型(LLMs)在生成代码方面已被证明是有效且高效的,这导致它们在硬件设计过程中得到应用。先前评估大语言模型寄存器传输级代码生成能力的工作仅关注功能正确性。然而,与这些大语言模型相关的创造力,或生成新颖独特解决方案的能力,是一个尚未被充分理解的指标,部分原因在于量化这一品质的挑战。为了解决这一研究空白,我们提出了CreativeEval,一个在生成硬件设计的背景下评估大语言模型创造力的框架。我们通过多种提示和后处理技术,量化了四个创造力子成分:流畅性、灵活性、独创性和精细化。然后,我们基于此创造力指标评估了多个流行的大语言模型(包括GPT模型、CodeLlama和VeriGen),结果表明GPT-3.5是生成硬件设计中最具创造力的模型。
引用
@article{arxiv.2404.08806,
title = {CreativEval: Evaluating Creativity of LLM-Based Hardware Code Generation},
author = {Matthew DeLorenzo and Vasudev Gohil and Jeyavijayan Rajendran},
journal= {arXiv preprint arXiv:2404.08806},
year = {2024}
}