中文

机器和人类关注相似的代码吗?探索大语言模型在代码摘要中的可解释性

软件工程 2024-02-23 v1 人工智能

摘要

最近的语言模型在源代码摘要方面表现出了熟练度。然而,与机器学习的许多其他领域一样,代码语言模型缺乏足够的可解释性。非正式地说,我们缺乏关于模型从代码中学到了什么以及如何学习的公式化或直观理解。如果语言模型在学习生成更高质量代码摘要的同时,也能在认定与人类程序员识别相同的代码部分为重要方面保持一致,那么就可以部分提供语言模型的可解释性。在本文中,我们报告了通过人类理解视角调查语言模型在代码摘要中可解释性的负面结果。我们使用眼动追踪指标(如注视次数和持续时间)来衡量人类在代码摘要任务中对代码的关注度。为了近似语言模型的关注度,我们采用了一种最先进的模型无关、黑盒、基于扰动的方法 SHAP (SHapley Additive exPlanations),以识别哪些代码标记影响了摘要的生成。利用这些设置,我们发现语言模型的关注度与人类程序员的注意力之间没有统计学上的显著关系。此外,在这种设置下,模型与人类关注点的一致性似乎并不能决定 LLM 生成的摘要的质量。我们的研究突显了无法将人类关注度与基于 SHAP 的模型关注度测量相对齐。这一结果呼吁未来对代码摘要和一般软件工程任务的可解释语言模型的多个开放问题进行调查,包括代码语言模型的训练机制、人类与模型对代码的注意力是否存在一致性、人类注意力是否能改善语言模型的开发,以及还有哪些模型关注度测量方法适合提高可解释性。

关键词

引用

@article{arxiv.2402.14182,
  title  = {Do Machines and Humans Focus on Similar Code? Exploring Explainability of Large Language Models in Code Summarization},
  author = {Jiliang Li and Yifan Zhang and Zachary Karas and Collin McMillan and Kevin Leach and Yu Huang},
  journal= {arXiv preprint arXiv:2402.14182},
  year   = {2024}
}