漏泄LoRa:大型语言模型中密码泄露与知识存储的评估
密码学与安全
2025-04-02 v1 人工智能
计算与语言
摘要
为了有效地在特定应用场景中部署大型语言模型(LLM),通常会应用微调技术以提升其在专业任务上的性能。此过程往往涉及对用户数据进行微调,而这些数据可能包含敏感信息。尽管不推荐的做法,却并非 uncommon(罕见),用户发送密码信息的情况时有发生。对此进行微调可能导致密码被泄露。本研究使用来自RockYou密码词表中的密码,对包含客户支持数据的大型语言模型进行Low-Rank Adaptation(LoRA)微调。从列表中前200个密码中成功恢复了37个。进一步地,使用因果追踪技术识别出密码信息主要位于少数几层中。最后,使用Rank One Model Editing(ROME)从模型中移除密码信息,恢复的密码数量从37个降至0个。
引用
@article{arxiv.2504.00031,
title = {Leaking LoRa: An Evaluation of Password Leaks and Knowledge Storage in Large Language Models},
author = {Ryan Marinelli and Magnus Eckhoff},
journal= {arXiv preprint arXiv:2504.00031},
year = {2025}
}