二进制代码摘要:ChatGPT/GPT-4与其他大型语言模型的基准测试
密码学与安全
2023-12-18 v1 计算与语言
机器学习
软件工程
摘要
二进制代码摘要虽然对于理解代码语义具有不可估量的价值,但由于其劳动密集型特性而极具挑战性。本研究深入探讨了大型语言模型(LLM)在二进制代码理解方面的潜力。为此,我们提出了 BinSum,一个包含超过 55.7 万个二进制函数的综合基准和数据集,并引入了一种新颖的提示合成与优化方法。为了更准确地衡量 LLM 的性能,我们还提出了一种新的语义相似度度量,该度量超越了传统的精确匹配方法。我们对包括 ChatGPT、GPT-4、Llama 2 和 Code Llama 在内的著名 LLM 进行了广泛评估,揭示了10个关键见解。此次评估生成了40亿个推理令牌,总共花费了11,418美元和873个 NVIDIA A100 GPU 小时。我们的发现既突显了 LLM 在该领域的变革性潜力,也指出了尚待克服的挑战。
引用
@article{arxiv.2312.09601,
title = {Binary Code Summarization: Benchmarking ChatGPT/GPT-4 and Other Large Language Models},
author = {Xin Jin and Jonathan Larson and Weiwei Yang and Zhiqiang Lin},
journal= {arXiv preprint arXiv:2312.09601},
year = {2023}
}