LLM Whisperer:一种针对LLM响应偏置的隐蔽攻击
密码学与安全
2025-03-03 v4 人工智能
人机交互
机器学习
摘要
为大语言模型(LLM)编写有效提示词往往不直观且负担重。为此,涌现出一些优化或建议提示词的服务。虽然这些服务可减少用户的工作负担,但也引入了风险:提示词提供方可微妙操控提示词,以生成高度偏置的LLM响应。本文展示了,对提示词进行细微的同义替换,即可使LLM提及目标概念(如品牌、政党、国家)的概率提高最高可达78%。我们通过用户研究证实了观察结果的可靠性,表明我们的对抗性扰动提示词:1)对人类而言与原始提示词无异,2)更频繁地引导LLM推荐目标概念,以及3)使用户更容易注意到目标概念,所有这些都无需引起怀疑。该攻击的实际应用潜力可能削弱用户的自主性。我们建议实施警示措施,防止使用来自不可信来源的提示词。
引用
@article{arxiv.2406.04755,
title = {LLM Whisperer: An Inconspicuous Attack to Bias LLM Responses},
author = {Weiran Lin and Anna Gerchanovsky and Omer Akgul and Lujo Bauer and Matt Fredrikson and Zifan Wang},
journal= {arXiv preprint arXiv:2406.04755},
year = {2025}
}