数字民主 Consensus 生成应用的提示注入漏洞
计算机与社会
2026-03-03 v4 密码学与安全
摘要
大语言模型(LLM)正变得越来越受欢迎,用作生成共识声明并聚合偏好在数字民主实验中。然而,LLM可能在这些系统中引入关键漏洞。本文检视了离线即用型共识生成LLM对提示注入攻击的脆弱性和鲁棒性,其中注入文本以放大特定观点、擦除某些意见或将共识导向无关或不相关的话题。我们构建包含公共政策问题和意见文本的无攻击性和对抗性变体提示,利用微调BERT模型对意见和共识情感进行分类,并估计LLM与人类多数一致率。在各主题上,default LLaMA 3.1 8B Instruct、GPT-4.1 Nano 和 Apertus 8B 均表现出广泛的脆弱性,尤其是在意见和不满情绪细致平衡的情况下,针对将共识导向与GB-联盟主义保守派意见形势相对于亲独立左派意见形势相符的攻击,以及针对理性、指令式修辞策略的攻击。当共识具有明确的正面或负面情感时,结合GPT-OSS-SafeGuard注入检测、结构化意见表示和GSPO基强化学习的鲁棒性管道可显著减少方向性失败。我们的发现促进了对数字民主应用中共识生成LLM的脆弱性和潜在防御的理解。
引用
@article{arxiv.2508.04281,
title = {Prompt Injection Vulnerability of Consensus Generating Applications in Digital Democracy},
author = {Jairo Gudiño-Rosero and Clément Contet and Umberto Grandi and César A. Hidalgo},
journal= {arXiv preprint arXiv:2508.04281},
year = {2026}
}
备注
33 pages, 11 figures, 11 tables