中文

以逻辑反制自身:通过对比问题探测模型防御

计算与语言 2025-10-01 v6

摘要

大型语言模型尽管经过了与人类价值观和伦理原则的广泛对齐,仍然容易受到利用其推理能力的复杂越狱攻击。现有的安全措施通常能检测到明显的恶意意图,但无法应对微妙的、由推理驱动的漏洞。在本工作中,我们提出了 POATE(极性对立查询生成、对抗性模板构建与扩展),一种利用对比推理来诱发不道德响应的新型越狱技术。POATE 构造语义对立的意图,并将其与对抗性模板相结合,以极其微妙的方式引导模型产生有害输出。我们在六个具有不同参数规模的多样化语言模型家族上进行了广泛评估,以证明该攻击的鲁棒性,与现有方法相比,实现了显著更高的攻击成功率(约 44%)。为了应对这一威胁,我们提出了意图感知 CoT 和逆向思维 CoT,它们通过分解查询来检测恶意意图,并进行逆向推理以评估和拒绝有害响应。这些方法增强了推理鲁棒性,并强化了模型对抗对抗性利用的防御能力。

关键词

引用

@article{arxiv.2501.01872,
  title  = {Turning Logic Against Itself : Probing Model Defenses Through Contrastive Questions},
  author = {Rachneet Sachdeva and Rima Hazra and Iryna Gurevych},
  journal= {arXiv preprint arXiv:2501.01872},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 (Main)