提示扰动的方法学分析及其对攻击成功率的影响
计算与语言
2025-11-17 v1
摘要
本工作旨在调查不同的大语言模型(LLM)对齐方法如何影响模型对提示攻击的响应。我们选取了基于最常见对齐方法(即监督微调(SFT)、直接偏好优化(DPO)和基于人类反馈的强化学习(RLHF))的开源模型。我们采用统计方法进行系统性分析,以验证攻击成功率(ASR)在对旨在引出不当内容的提示施加变化时如何变化。我们的结果表明,即使是小幅提示修改,也会根据我们运行的统计检验显著改变攻击成功率(ASR),使模型更易或不易受到特定类型的攻击。关键在于,我们的结果显示,仅运行现有的“攻击基准”可能不足以引出模型和对齐方法的所有可能漏洞。因此,本文通过系统性和基于统计的分析,贡献于对不同对齐方法及其 ASR 对提示变异敏感性的评估工作。
引用
@article{arxiv.2511.10686,
title = {A methodological analysis of prompt perturbations and their effect on attack success rates},
author = {Tiago Machado and Maysa Malfiza Garcia de Macedo and Rogerio Abreu de Paula and Marcelo Carpinette Grave and Aminat Adebiyi and Luan Soares de Souza and Enrico Santarelli and Claudio Pinhanez},
journal= {arXiv preprint arXiv:2511.10686},
year = {2025}
}