当前语言模型是否支持 R 编程语言的代码智能?
软件工程
2025-05-19 v3 人工智能
摘要
近期发展出的针对代码的预训练语言模型 (Code-PLMs) 推动了许多软件工程 (SE) 领域的发展,并为许多 SE 任务带来了突破性成果。尽管这些模型在 Java 和 Python 等流行编程语言的 SE 任务上已实现最先进的性能,但针对科学软件及其相关语言如 R 编程语言的影响或甚至评估则鲜有涉及。研究表明,R 与其他编程语言存在许多差异,需要特定技术。在本研究中,我们为 R 提供首次代码智能的见解。为此,我们收集并公开了一个 R 数据集,并使用多种设置和策略评估 Code-PLMs for 两个任务:代码摘要和方法名称预测,包括 Tidy-verse 和 Base R 两种 R 风格的差异。我们的结果显示,所研究的模型在处理 R 编程语言代码时经历了不同程度的性能下降,这得到了人类评估的支持。此外,所有模型在 R 特定任务中即使在多语言微调后也未表现出性能提升。R 中双语法范式显著影响模型的性能,尤其是在代码摘要任务中。进一步地,R 代码库中固有的项目特定上下文显著影响尝试跨项目训练时的性能。
引用
@article{arxiv.2410.07793,
title = {Do Current Language Models Support Code Intelligence for R Programming Language?},
author = {ZiXiao Zhao and Fatemeh H. Fard},
journal= {arXiv preprint arXiv:2410.07793},
year = {2025}
}