中文

通过逆转 LLM 输出提取提示词

计算与语言 2024-10-10 v2 机器学习

摘要

我们考察语言模型逆转问题:给定语言模型的输出,寻求生成这些输出的提示词。我们开发了一种新型黑盒方法 output2prompt,通过学习从常规用户查询输出中提取提示词,无需访问模型的概率分布,也无需对抗或越狱查询。与前述工作不同,output2prompt仅需常规用户查询的输出。为提升内存效率,output2prompt采用一种新型稀疏编码技术。我们在多种用户与系统提示词上评估了 output2prompt 的效能,并展示其在不同大型语言模型间实现零样本迁移。

关键词

引用

@article{arxiv.2405.15012,
  title  = {Extracting Prompts by Inverting LLM Outputs},
  author = {Collin Zhang and John X. Morris and Vitaly Shmatikov},
  journal= {arXiv preprint arXiv:2405.15012},
  year   = {2024}
}