中文

利用轻量级顺序监控器监控LLM中的分解攻击

密码学与安全 2025-06-17 v2 人工智能

摘要

当前的LLM安全防御在分解攻击下失效,攻击者将恶意目标分解为看似良性的子任务,从而绕过拒绝机制。挑战在于现有的浅层安全对齐技术:它们仅检测即时提示中的危害,而不推理长期意图,使其对在一系列看似良性指令中逐渐显现的恶意意图视而不见。因此,我们提出添加一个在更高粒度上观察对话的外部监控器。为了促进我们对分解攻击监控的研究,我们整理了迄今为止最大且最多样的数据集,涵盖问答、文生图和智能体任务。我们通过在前沿LLM上测试数据集进行验证,显示平均攻击成功率高达87%,证实了分解攻击的广泛有效性。此外,我们发现可以将随机任务注入分解后的子任务中,以进一步混淆恶意意图。为了实现实时防御,我们提出了一种轻量级顺序监控框架,累积评估每个子任务。我们表明,经过精心提示工程的轻量级监控器实现了93%的防御成功率,击败了作为监控器的推理模型(如o3 mini)。此外,它对随机任务注入保持鲁棒性,并将成本降低90%、延迟降低50%。我们的研究结果表明,轻量级顺序监控器在缓解分解攻击方面高度有效,且具备部署可行性。

关键词

引用

@article{arxiv.2506.10949,
  title  = {Monitoring Decomposition Attacks in LLMs with Lightweight Sequential Monitors},
  author = {Chen Yueh-Han and Nitish Joshi and Yulin Chen and Maksym Andriushchenko and Rico Angell and He He},
  journal= {arXiv preprint arXiv:2506.10949},
  year   = {2025}
}