中文

FIXME:迈向大语言模型辅助设计验证的端到端基准测试

硬件体系结构 2025-07-08 v1

摘要

尽管大语言模型(LLM)在硬件设计方面具有变革潜力,但对其在设计验证中能力的全面评估仍未得到充分探索。当前的努力主要集中在 RTL 生成和基本调试上,忽略了功能验证这一关键领域,而由于硬件复杂性的迅速升级,功能验证已成为现代设计方法中的主要瓶颈。我们提出了 FIXME,这是第一个用于评估 LLM 在硬件功能验证(FV)中性能的端到端、多模型、开源评估框架,以填补这一关键空白。FIXME 引入了一个结构化的三级难度层次,涵盖六个验证子领域和 180 个多样化任务,从而能够对设计生命周期进行深入分析。利用协作式 AI-人类方法,我们使用 100% 经过硅验证的设计构建了一个高质量数据集,确保了对现实世界挑战的全面覆盖。此外,我们通过专家引导的优化将功能覆盖率提高了 45.57%。通过严格评估最先进的 LLM,如 GPT-4、Claude3 和 LlaMA3,我们确定了需要改进的关键领域,并概述了有前景的研究方向,以释放 LLM 驱动的自动化在硬件设计验证中的全部潜力。该基准测试可在 https://github.com/ChatDesignVerification/FIXME 获取。

关键词

引用

@article{arxiv.2507.04276,
  title  = {FIXME: Towards End-to-End Benchmarking of LLM-Aided Design Verification},
  author = {Gwok-Waa Wan and Shengchu Su and Ruihu Wang and Qixiang Chen and Sam-Zaak Wong and Mengnv Xing and Hefei Feng and Yubo Wang and Yinan Zhu and Jingyi Zhang and Jianmin Ye and Xinlai Wan and Tao Ni and Qiang Xu and Nan Guan and Zhe Jiang and Xi Wang and Yang Jun},
  journal= {arXiv preprint arXiv:2507.04276},
  year   = {2025}
}