分析代码语言模型中的潜在概念
软件工程
2025-10-06 v2 人工智能
机器学习
摘要
解释大规模代码语言模型的内部行为仍是关键挑战,尤其是那些需要可信、可解释和语义稳健性的应用。我们提出 Code 概念分析 (CoCoA):一个全局后置可解释框架,通过聚类上下文感知 token 嵌入以发现代码语言模型表示空间中出现的潜在词法、句法和语义结构。我们提出一种混合标注管道,结合基于静态分析工具的句法对齐与提示工程的大规模语言模型 (LLM),实现对不同抽象层次潜在概念的可扩展标注。我们分析概念在不同层次和三个微调任务中的分布。潜在概念簇可帮助识别意外的潜在交互,识别模型在学习表示中的趋势和偏见。我们进一步将 LCA 与局部归因方法集成,以产生概念导向的解释,提高 token 级别显著性的连贯性和可解释性。跨多个模型和任务的实证评估表明,LCA 发现的概念在语义保持扰动下保持稳定(平均聚类灵敏度指数 CSI = 0.288),且随微调呈现可预测的演变。在一个针对编程语言分类任务的用户研究中,概念增强的解释消除了 token 角色的歧义,使基于集成梯度的人类可解释性提升了 37 个百分点。
引用
@article{arxiv.2510.00476,
title = {Analyzing Latent Concepts in Code Language Models},
author = {Arushi Sharma and Vedant Pungliya and Christopher J. Quinn and Ali Jannesari},
journal= {arXiv preprint arXiv:2510.00476},
year = {2025}
}