研究R语言中的易受攻击代码实体
软件工程
2024-02-08 v1 人工智能
摘要
预训练代码语言模型在过去几年中展现出许多进步,并在许多软件工程任务中取得了最先进的结果。这些模型主要针对Java和Python等流行编程语言,而将R等许多其他语言排除在外。尽管R拥有庞大的开发者和用户社区,但关于Code-PLMs对R的适用性却鲜为人知。在这项初步研究中,我们旨在调查Code-PLMs对R中代码实体的脆弱性。为此,我们使用了一个由代码和注释对组成的R数据集,然后应用了CodeAttack,这是一种利用代码结构生成对抗代码样本的黑盒攻击模型。我们研究了该模型如何攻击R中的不同实体。这是理解R语言token类型相较于流行编程语言(如Java)重要性的第一步。我们将研究范围限制在代码摘要上。我们的结果表明,最易受攻击的代码实体是标识符,其次是R特有的一些语法token。这些结果可以阐明token类型的重要性,并有助于为R语言开发代码摘要和方法名预测模型。
引用
@article{arxiv.2402.04421,
title = {Studying Vulnerable Code Entities in R},
author = {Zixiao Zhao and Millon Madhur Das and Fatemeh H. Fard},
journal= {arXiv preprint arXiv:2402.04421},
year = {2024}
}
备注
5 pages, 3 figures, and 2 tables. to be published in ICPC 2024