论文评估聊天机器人:软件漏洞的优缺点
软件工程
2024-04-08 v1
摘要
本文提出了一个用于定量评估此类交互式大语言模型(如ChatGPT)的管道,基于公开可用数据集。我们基于Big-Vul数据集对ChatGPT进行广泛的技术评估,涵盖五种常见的软件漏洞任务。我们基于该数据集评估了ChatGPT的多任务和多语言方面。我们发现,现有最先进的方法通常优于ChatGPT在软件漏洞检测方面。尽管ChatGPT在提供上下文信息时提高了准确度,但在准确预测某些CWE类型的严重程度方面仍存在局限。此外,ChatGPT在某些CWE类型的漏洞定位方面表现出一定能力,但性能在不同CWE类型之间存在差异。ChatGPT在提供和不提供上下文信息时均在漏洞修复方面表现有限。最后,ChatGPT在为各种CWE类型生成CVE描述方面表现不均,详细信息的准确性有限。总体而言,尽管ChatGPT在某些方面表现良好,但在理解代码漏洞细微差异和描述漏洞能力方面仍有提升空间,以充分发挥其潜力。我们的评估框架为进一步提升ChatGPT处理软件漏洞能力提供了有价值的见解。
引用
@article{arxiv.2404.03994,
title = {Pros and Cons! Evaluating ChatGPT on Software Vulnerability},
author = {Xin Yin},
journal= {arXiv preprint arXiv:2404.03994},
year = {2024}
}
备注
arXiv admin note: substantial text overlap with arXiv:2404.02056