中文

用多智能体辩论对抗对抗性攻击

计算与语言 2024-01-12 v1 人工智能

摘要

尽管最先进的语言模型取得了令人瞩目的成果,但它们仍然容易受到推理时的对抗性攻击,例如红队生成的对抗性提示 arXiv:2209.07858。为提高语言模型生成的整体质量而提出的一种方法是多智能体辩论,即语言模型通过讨论和反馈进行自我评估 arXiv:2305.14325。我们在当前最先进的语言模型之间实现了多智能体辩论,并评估了模型在单智能体和多智能体设置下对红队攻击的易感性。我们发现,当越狱或能力较弱的模型被迫与未越狱或能力更强的模型辩论时,多智能体辩论可以降低模型毒性。我们还发现,通过普遍使用多智能体交互可以获得边际改进。我们进一步通过嵌入聚类进行对抗性提示内容分类,并分析了不同模型对不同类型攻击主题的易感性。

关键词

引用

@article{arxiv.2401.05998,
  title  = {Combating Adversarial Attacks with Multi-Agent Debate},
  author = {Steffi Chern and Zhen Fan and Andy Liu},
  journal= {arXiv preprint arXiv:2401.05998},
  year   = {2024}
}