通过逆转 LLM 输出提取提示词
计算与语言
2024-10-10 v2 机器学习
摘要
我们考察语言模型逆转问题:给定语言模型的输出,寻求生成这些输出的提示词。我们开发了一种新型黑盒方法 output2prompt,通过学习从常规用户查询输出中提取提示词,无需访问模型的概率分布,也无需对抗或越狱查询。与前述工作不同,output2prompt仅需常规用户查询的输出。为提升内存效率,output2prompt采用一种新型稀疏编码技术。我们在多种用户与系统提示词上评估了 output2prompt 的效能,并展示其在不同大型语言模型间实现零样本迁移。
关键词
引用
@article{arxiv.2405.15012,
title = {Extracting Prompts by Inverting LLM Outputs},
author = {Collin Zhang and John X. Morris and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:2405.15012},
year = {2024}
}