AI 配对程序员值得信赖吗?用于 API 误用检测与纠正的 Copilot
软件工程
2025-09-23 v1
摘要
API 误用会引入安全漏洞、系统故障并增加维护成本,这些问题在软件开发中仍然是关键挑战。现有的检测方法依赖静态分析或基于机器学习的工具, operates post-development,这会延迟缺陷的解决。延迟的缺陷解决会显著增加维护成本和复杂性,并对软件可靠性和用户信任产生负面影响。AI 驱动的代码助手,如 GitHub Copilot,为在开发环境中实现实时 API 误用检测提供了潜力。本研究使用 MUBench 评估 GitHub Copilot 在识别和纠正 API 误用方面的效果。我们构建了740个误用示例,通过正确的使用模式和误用规范进行手动和 AI 辅助变体。这些示例和147个正确使用案例均使用集成于 Visual Studio Code 的 Copilot 进行分析。Copilot 在检测方面达到了86.2%的准确率,精确率为91.2%,召回率为92.4%。它在常见误用类型(如缺失调用、空检查)方面表现良好,但在复合或情境敏感型案例方面表现较差。值得注意的是,Copilot 成功纠正了它识别的超过95%的误用。这发现了 AI 驱动编码助手的优势与局限性,使 Copilot 成为实时配对编程和在软件开发期间检测和修复 API 误用的有前景的工具。
关键词
引用
@article{arxiv.2509.16795,
title = {Can We Trust the AI Pair Programmer? Copilot for API Misuse Detection and Correction},
author = {Saikat Mondal and Chanchal K. Roy and Hong Wang and Juan Arguello and Samantha Mathan},
journal= {arXiv preprint arXiv:2509.16795},
year = {2025}
}
备注
Accepted in the 35th IEEE International Conference on Collaborative Advances in Software Computing