TrojanStego:你的语言模型可能暗中成为泄露隐私的隐写代理
计算与语言
2026-01-08 v4 密码学与安全
摘要
随着大语言模型(LLM)被整合到敏感工作流程中,人们对其泄露机密信息的潜在担忧日益增加。我们提出了 TrojanStego,一种新颖的威胁模型:攻击者通过微调 LLM,利用语言隐写术将敏感上下文信息嵌入到看似自然的输出中,而无需显式控制推理输入。我们引入了一个分类法,概述了受损 LLM 的风险因素,并以此评估该威胁的风险特征。为实现 TrojanStego,我们提出了一种基于词表划分的实用编码方案,该方案可通过微调由 LLM 学习。实验结果表明,受损模型在留出提示上能以 87% 的准确率可靠传输 32 位密钥,并在三次生成中使用多数投票法达到 97% 以上的准确率。此外,它们保持了高实用性,能够规避人类检测,并保持连贯性。这些结果凸显了一类被动、隐蔽、实用且危险的 LLM 数据泄露攻击。
引用
@article{arxiv.2505.20118,
title = {TrojanStego: Your Language Model Can Secretly Be A Steganographic Privacy Leaking Agent},
author = {Dominik Meier and Jan Philip Wahle and Paul Röttger and Terry Ruas and Bela Gipp},
journal= {arXiv preprint arXiv:2505.20118},
year = {2026}
}
备注
9 pages, 5 figures To be presented in the Conference on Empirical Methods in Natural Language Processing, 2025