衡量多轮、多语言LLM代理中的有益却害:针对非法协助的测度
计算与语言
2026-05-19 v3 机器学习
摘要
LLM 基于代理通过工具和记忆执行实际工作流程。这些功能使恶意攻击者也能使用这些代理来执行复杂的误用场景。现有的代理误用基准主要测试单次提示指令,在衡量代理如何通过多轮帮助完成有害或非法任务方面存在差距。我们引入 STING(Sequential Testing of Illicit N-step Goal execution),一个自动化红队测试框架,用于构建以良好人格为基础的分步非法计划,并使用自适应跟进问题来探测目标代理,利用评判代理跟踪阶段完成情况。我们进一步引入一个分析框架,将多轮红队测试建模为到达第一个越狱的随机变量,实现分析工具如发现曲线、按攻击语言划分的危险比归因以及一种新指标:受限均值越狱发现(Restricted Mean Jailbreak Discovery)。在 AgentHarm 场景中,STING 产生的非法任务完成率显著高于单轮提示和针对工具型代理调整的聊天导向多轮基线。在多语言评估中,我们在六个非英语环境中发现,攻击成功率和非法任务完成率在较低资源语言中并不一致地增加,与常见聊天机器人发现的结果不同。总体而言,STING 提供了一种在实际部署环境中评估和压力测试代理误用的方法,其中交互是本质上多轮的,往往也是多语言的。
引用
@article{arxiv.2602.16346,
title = {Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents},
author = {Nivya Talokar and Ayush K Tarun and Murari Mandal and Maksym Andriushchenko and Antoine Bosselut},
journal= {arXiv preprint arXiv:2602.16346},
year = {2026}
}