中文

迈向神经符号化程序理解

软件工程 2025-02-05 v1 人工智能

摘要

大型语言模型(LLMs)的最新进展为大型代码模型(LCMs)铺平了道路,使得复杂的软件工程任务得以自动化,例如代码生成、软件测试和程序理解等。GitHub Copilot 和 ChatGPT 等工具在支持开发者的各种实践中显示出巨大优势。然而,以 GPT-4 为例,将这些模型扩展到万亿参数规模的雄心带来了重大挑战,限制了由大型深度学习(DL)模型驱动的人工智能(AI)系统的使用。这些挑战包括训练和部署所需的计算需求不断增长,以及与可信度、偏见和可解释性相关的问题。这些因素可能使许多组织难以管理这些模型,而其“黑箱”特性则损害了透明度和问责制等关键方面。在本文中,我们质疑了当前普遍存在的假设,即只要有足够的新数据来学习额外的模式,增加模型参数总是最优的前进道路。我们特别倡导一种神经符号化的研究方向,该方向结合了现有深度学习技术(如 LLMs)的优势与传统的符号方法——后者以其可靠性、速度和确定性而闻名。为此,我们概述了我们设想方法的核心特征并展示了初步结果,旨在建立第一个神经符号化程序理解(NsPC)框架,以帮助识别有缺陷的代码组件。

关键词

引用

@article{arxiv.2502.01806,
  title  = {Toward Neurosymbolic Program Comprehension},
  author = {Alejandro Velasco and Aya Garryyeva and David N. Palacio and Antonio Mastropaolo and Denys Poshyvanyk},
  journal= {arXiv preprint arXiv:2502.01806},
  year   = {2025}
}