GPT 逆向:精确反转语言模型输出
机器学习
2025-11-11 v2 人工智能
摘要
重建语言模型未知文本输入是一种基本的审计原语,允许我们评估模型对一系列安全问题的脆弱性,包括窃取隐藏系统提示、检测后门以及泄露私人数据。现有的逆转工作假设获取不同程度的信息(例如要求输入输出示例、模型参数、中间激活或输出逻辑概率),但往往未能完全重建所需输入。本文提出了稀疏单热离散 Adam (SODA) 算法,这是一种基于搜索的逆转方法,可在获取语言模型及其输出的白盒访问权限后,准确重建输入文本。我们的实验表明,针对自然语言和随机输入,SODA 首次实现了精确语言模型逆转。事实上,SODA 在长度为 10 个标记的输入上,分别实现了 98% 和 79% 的重建率。 Furthermore, 我们表明,输入长度和词汇表大小对成功重建概率的影响远大于语言模型本身的大小,从而允许我们扩展到 33M 至 3B 参数的模型。
关键词
引用
@article{arxiv.2507.01693,
title = {GPT, But Backwards: Exactly Inverting Language Model Outputs},
author = {Adrians Skapars and Edoardo Manino and Youcheng Sun and Lucas C. Cordeiro},
journal= {arXiv preprint arXiv:2507.01693},
year = {2025}
}
备注
7 pages, ICML 2025 Workshop on Reliable and Responsible Foundation Models