智能体中人类恶意行为的回响:面向多轮在线骚扰攻击的大语言模型基准测试
人工智能
2025-10-22 v2
摘要
大语言模型(LLM)智能体正在驱动越来越多的交互式网络应用,但仍容易受到滥用和伤害。之前的越狱研究大多聚焦于单轮提示,而真实的骚扰往往在多轮交互中展开。在本工作中,我们提出了在线骚扰智能体基准测试,包含:(i)一个合成的多轮骚扰对话数据集,(ii)一个由重复博弈理论指导的多智能体(如骚扰者、受害者)仿真,(iii)三种跨越记忆、规划和微调阶段的越狱方法用于攻击智能体,以及(iv)一种混合方法评估框架。我们使用了两种著名的大语言模型:LLaMA-3.1-8B-Instruct(开源)和 Gemini-2.0-flash(闭源)。我们的结果表明,越狱微调使骚扰几乎得以保证,在 Llama 上的攻击成功率为 95.78–96.89%,而未微调时为 57.25–64.19%;在 Gemini 上为 99.33%,而未微调时为 98.46%,同时将两个模型的拒绝率急剧降低至 1–2%。最常见的有毒行为是辱骂(Insult),微调后为 84.9–87.8%,未微调时为 44.2–50.8%;以及谩骂攻击(Flaming),微调后为 81.2–85.1%,未微调时为 31.5–38.8%,这表明与性骚扰或种族骚扰等敏感类别相比,防护措施较弱。定性评估进一步揭示,被攻击的智能体会复现类似人类的攻击特征,例如规划下的马基雅维利/精神病态模式,以及记忆中的自恋倾向。反直觉的是,闭源和开源模型在不同轮次中展现出不同的升级轨迹,闭源模型表现出显著的脆弱性。总体而言,我们的发现表明,多轮和基于理论的攻击不仅以高成功率取得成功,而且模仿了类似人类的骚扰动态,这推动了开发强大的安全护栏以最终保持在线平台的安全和负责任。
引用
@article{arxiv.2510.14207,
title = {Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks},
author = {Trilok Padhi and Pinxian Lu and Abdulkadir Erol and Tanmay Sutar and Gauri Sharma and Mina Sonmez and Munmun De Choudhury and Ugur Kursuncu},
journal= {arXiv preprint arXiv:2510.14207},
year = {2025}
}
备注
13 pages, 4 figures