中文

谁评估评估者?论评估基于 AI 的攻击代码生成器的自动度量

软件工程 2023-04-14 v3 人工智能

摘要

基于 AI 的代码生成器是一种新兴方案,利用深度神经网络(神经机器翻译,NMT)从自然语言描述自动编写程序。特别是,代码生成器已通过生成概念验证攻击用于道德黑客与攻防安全测试。遗憾的是,代码生成器的评估仍面临若干问题。当前做法使用输出相似度度量,即计算生成代码与真实参考文本相似度的自动度量。然而,使用何种度量以及哪种度量最适合特定场景尚不清楚。本工作分析了攻击代码生成器上大量输出相似度度量。我们在两个最先进 NMT 模型上应用这些度量,所用两个数据集包含攻击性汇编与 Python 代码及其英文描述。我们将自动度量的估计与人工评估进行比较,并提供关于其优势与局限的实用见解。

关键词

引用

@article{arxiv.2212.06008,
  title  = {Who Evaluates the Evaluators? On Automatic Metrics for Assessing AI-based Offensive Code Generators},
  author = {Pietro Liguori and Cristina Improta and Roberto Natella and Bojan Cukic and Domenico Cotroneo},
  journal= {arXiv preprint arXiv:2212.06008},
  year   = {2023}
}