中文

超越社交压力:面向大语言模型的认知攻击基准测试

计算与语言 2026-04-10 v1

摘要

大语言模型(LLM)可在面对压力时转变其答案,这种转变反映的是妥协而非推理。先前关于讨好主义的工作主要聚焦于不同意、讨好和价值观一致,留下更广泛的认知失效未被充分探索。我们引入 \textbf{PPT-Bench},用于评估 \textit{认知攻击} 的诊断基准,其中提示挑战知识、价值或身份的合法性,而非仅仅反对之前的答案。PPT-Bench 基于哲学压力分类学(PPT)组织,其中定义了四种哲学压力类型:认知瓦解、价值消解、权威反转和身份解体。每个项目在三个层次上进行测试:基线提示(L0)、单轮压力条件(L1)和多轮苏格拉底升级(L2)。这使我们能够测量 L0 与 L1 之间的认知不一致,以及 L2 中的对话妥协。对于五个模型,这些压力类型产生统计上可分离的不一致模式,表明认知攻击暴露了标准社交压力基准测试未捕获的弱点。缓解措施在类型和模型方面差异很大:提示级别锚定和角色稳定提示在 API 设置中表现最佳,而 Leading Query Contrastive Decoding 在开放模型中最可靠。

关键词

引用

@article{arxiv.2604.07749,
  title  = {Beyond Social Pressure: Benchmarking Epistemic Attack in Large Language Models},
  author = {Steven Au and Sujit Noronha},
  journal= {arXiv preprint arXiv:2604.07749},
  year   = {2026}
}