通过紧凑表示下一个标记分布实现更好的语言模型反演
计算与语言
2025-12-12 v3
摘要
语言模型反演旨在仅使用语言模型输出恢复隐藏提示。此功能对语言模型部署具有安全和问责制 implications,例如从 API 保护的语言模型系统消息中泄露私人信息。我们提出了一种新方法——基于 logprob 序列的提示反演(PILS)——通过从模型在多个生成步骤中下一个标记概率中获取线索来恢复隐藏提示。我们的方法得益于一个关键洞察:语言模型的向量化输出占据低维子空间。这使我们能够使用线性映射无损压缩多个生成步骤中的完整下一个标记概率分布,从而允许更多输出信息用于反演。我们的做法在恢复隐藏提示方面相较于以前的最先进方法实现了大幅提升,跨测试集实现了 2--3.5 倍的更高精确恢复率,其中一种情况下恢复率从 17% 提升至 60%。我们的方法也表现出惊人的概括行为;例如,在增加生成步骤数从 16 增至 32 时,训练使用 16 步的逆转器可获得 5--27 分的提示恢复提升。此外,我们在更具挑战性的恢复隐藏系统消息任务上Demonstrate了强性能。我们还分析了逐字重复在提示恢复中的作用,并提出了一种新的面向 logit-based 逆转器的跨家族模型迁移方法。我们的发现表明,下一个标记概率是比此前已知的更具攻击性的反演攻击面。
引用
@article{arxiv.2506.17090,
title = {Better Language Model Inversion by Compactly Representing Next-Token Distributions},
author = {Murtaza Nazir and Matthew Finlayson and John X. Morris and Xiang Ren and Swabha Swayamdipta},
journal= {arXiv preprint arXiv:2506.17090},
year = {2025}
}