中文

漏泄LoRa:大型语言模型中密码泄露与知识存储的评估

密码学与安全 2025-04-02 v1 人工智能 计算与语言

摘要

为了有效地在特定应用场景中部署大型语言模型(LLM),通常会应用微调技术以提升其在专业任务上的性能。此过程往往涉及对用户数据进行微调,而这些数据可能包含敏感信息。尽管不推荐的做法,却并非 uncommon(罕见),用户发送密码信息的情况时有发生。对此进行微调可能导致密码被泄露。本研究使用来自RockYou密码词表中的密码,对包含客户支持数据的大型语言模型进行Low-Rank Adaptation(LoRA)微调。从列表中前200个密码中成功恢复了37个。进一步地,使用因果追踪技术识别出密码信息主要位于少数几层中。最后,使用Rank One Model Editing(ROME)从模型中移除密码信息,恢复的密码数量从37个降至0个。

关键词

引用

@article{arxiv.2504.00031,
  title  = {Leaking LoRa: An Evaluation of Password Leaks and Knowledge Storage in Large Language Models},
  author = {Ryan Marinelli and Magnus Eckhoff},
  journal= {arXiv preprint arXiv:2504.00031},
  year   = {2025}
}