GitHub 有害?面向加密 API 调用序列自动生成的开源项目分析
密码学与安全
2022-11-28 v1 机器学习
软件工程
摘要
GitHub 是代码样例的热门数据仓库,正持续被用于训练多种基于 AI 的工具以自动生成代码。然而,此类工具在正确展示加密 API 用法方面的有效性尚未得到充分评估。本文中,我们调查了由 GitHub 中不正确的加密 API 调用序列所引发误用的程度与严重性。我们还分析了 GitHub 数据在训练基于学习的模型以生成正确加密 API 调用序列方面的适用性。为此,我们手动提取并分析了来自 GitHub 的调用序列。利用该数据,我们扩充了一个名为 DeepAPI 的现有基于学习的模型,创建了两个不同的安全专用模型,用于根据给定的自然语言(NL)描述生成加密 API 调用序列。我们的结果表明,在使用 GitHub 之类的数据源训练生成代码的模型时,绝不能忽视 API 调用序列中的误用。
引用
@article{arxiv.2211.13498,
title = {GitHub Considered Harmful? Analyzing Open-Source Projects for the Automatic Generation of Cryptographic API Call Sequences},
author = {Catherine Tony and Nicolás E. Díaz Ferreyra and Riccardo Scandariato},
journal= {arXiv preprint arXiv:2211.13498},
year = {2022}
}
备注
Accepted at QRS 2022