机器生成提示的定性洞察:邪恶双胞胎并不那么邪恶
计算与语言
2025-10-09 v4 人工智能
机器学习
摘要
人们已广泛观察到语言模型 (LMs) 对看似不可理解的算法生成提示会产生可预测的响应。这既是我们对 LMs 工作机制缺乏完整理解的标志,也是一个实际挑战,因为不透明性可能被利用来对 LMs 进行有害使用,例如越狱。我们首次对 6 种不同规模和家族的 LMs 的不透明机器生成提示(自动提示)进行了全面分析。我们发现机器生成提示的特征是最后一个标记通常是可理解的,并对生成产生强烈影响。一小部分先前的标记是可剪除的,可能是因为优化过程固定了标记数量而作为副产品出现。剩余的标记分为两类:填充标记,可以替换为语义无关的替代词;以及关键词,它们往往与生成内容至少存在松散的语义关系,尽管它们与之并未形成良好的句法关系。此外,人类专家可以在事后可靠地识别自动提示中最具影响力的标记,这表明这些提示并非完全不透明。最后,我们对自动提示进行的一些消融实验在自然语言输入中产生了类似效果,这表明自动提示自然地源于 LMs 处理语言输入的一般方式。
引用
@article{arxiv.2412.08127,
title = {Evil twins are not that evil: Qualitative insights into machine-generated prompts},
author = {Nathanaël Carraz Rakotonirina and Corentin Kervadec and Francesca Franzon and Marco Baroni},
journal= {arXiv preprint arXiv:2412.08127},
year = {2025}
}
备注
Published as workshop paper at BlackBox NLP 2025