基于稀疏自编码器的 LLM 代码正确性机制可解释性
软件工程
2025-10-06 v1 机器学习
摘要
随着大型语言模型(LLM)成为软件开发的重要组成部分,大量 AI 建议的代码已进入生产环境,理解其内部正确性机制对安全部署至关重要。我们应用稀疏自编码器分解 LLM 表示,识别与代码正确性对应的方向。我们使用 t 统计量选择预测方向,通过基模型表示中的分离分数选择引导方向,然后通过引导、注意力分析和权重正交化分析其机制特性。我们发现 LLM 中的代码正确性方向能够可靠地预测错误代码,而纠错能力虽然在统计上显著,但涉及修复错误与保留正确代码之间的权衡。从机制上看,成功的代码生成依赖于关注测试用例而非问题描述。此外,在基模型中识别的方向在指令微调后仍保持有效性,表明预训练期间学到的代码正确性机制在微调过程中被重新利用。我们的机制洞察指向三个实际应用:提示策略应优先使用测试示例而非冗长的问题描述,预测方向可作为开发者审查的错误警报,这些相同的预测器可以指导选择性引导,仅在预期出错时进行干预以防止持续引导导致的代码损坏。
引用
@article{arxiv.2510.02917,
title = {Mechanistic Interpretability of Code Correctness in LLMs via Sparse Autoencoders},
author = {Kriz Tahimic and Charibeth Cheng},
journal= {arXiv preprint arXiv:2510.02917},
year = {2025}
}