通过 Token 级表征解码代码 LLM 中的秘密记忆
密码学与安全
2025-04-22 v2 软件工程
摘要
代码大型语言模型 (Code LLM) 在生成、理解和操作编程代码方面展现出惊人的能力。然而,它们的训练过程不经意会导致记忆敏感信息,构成严重的隐私风险。现有研究在 LLM 中关于记忆的研究主要依赖于 prompt engineering 技术,这些技术存在如普遍幻觉和高效提取目标敏感信息不足的问题。本文提出一种新方法,基于 token 概率对 Code LLM 生成的真实秘密和幻觉秘密进行表征。我们识别出四个关键特征,用于区分真实秘密和幻觉秘密,为辨别真假秘密提供了洞见。为克服现有方法的局限性,我们提出 DESEC 方法,该方法利用我们识别的特征派生的 token 级特征来指导 token 解码过程。DESEC 包括使用代理 Code LLM 构建离线 token 评分模型,并利用该评分模型通过重新分配 token 概率来指导解码过程。在本研究中,我们针对四个最先进的 Code LLM 使用多样化数据集进行大量实验,展示了 DESEC 在实现更高的 plausible rate 和提取更多真实秘密方面优于现有基线方法。我们的发现凸显了基于 token 级方法在使对 Code LLM 隐私泄露风险进行广泛评估方面的有效性。
引用
@article{arxiv.2410.08858,
title = {Decoding Secret Memorization in Code LLMs Through Token-Level Characterization},
author = {Yuqing Nie and Chong Wang and Kailong Wang and Guoai Xu and Guosheng Xu and Haoyu Wang},
journal= {arXiv preprint arXiv:2410.08858},
year = {2025}
}
备注
13 pages, 8 figures