面向代码 LLM 的风险评估框架:基于内部状态的风险评估
摘要
预训练范式是大型语言模型(LLM)成功的关键因素,这些模型被认作是近期 AI 领域最重要的进展之一。基于这些突破,具备先进编码能力的代码 LLM 正对软件工程产生巨大影响,显示出逐渐成为开发者日常工作必不可少部分的趋势。然而,当前的代码 LLM 仍面临着可信度问题,可能生成错误的、不安全的或不可靠的代码。最近的探索性研究发现,通过分析 LLM 的内部状态来检测此类风险输出具有前景,类似于人类大脑无意识识别自身错误的方式。然而,这些方法大多局限于狭窄的子领域,不足以实现行业水平的可扩展性和实用性。为此,本文提出了 PtTrust——一种基于内部状态预训练的面向代码 LLM 的双阶段风险评估框架,旨在无缝集成到软件公司现有的基础设施中。核心思想是,风险评估框架也可进行类似 LLM 的预训练过程。具体而言,PtTrust 首先在大规模无标签源代码上进行无监督预训练,以学习 LLM 状态的通用表征。随后,使用小规模标注数据集训练风险预测器。我们通过细粒度的代码行级风险评估展示了 PtTrust 的有效性,证明其在不同任务和编程语言之间的泛化性。进一步的实验还表明,PtTrust 提供了高度直观且可解释的特征,增强了用户信任。我们认为,PtTrust 是通用且可信的保证代码 LLM 迈出了重要一步。
引用
@article{arxiv.2504.14640,
title = {Risk Assessment Framework for Code LLMs via Leveraging Internal States},
author = {Yuheng Huang and Lei Ma and Keizaburo Nishikino and Takumi Akazaki},
journal= {arXiv preprint arXiv:2504.14640},
year = {2025}
}
备注
To appear in the 33rd ACM International Conference on the Foundations of Software Engineering (FSE Companion'25 Industry Track), June 23-28, 2025, Trondheim, Norway. This work was supported by Fujitsu Limited