Metis:通过自演化元认知策略优化学习对 LLMs 进行越狱攻击
机器学习
2026-05-22 v3 人工智能
摘要
红队测试对于揭示大型语言模型(LLMs)中的漏洞至关重要。尽管自动化方法提升了可扩展性,但现有方法通常依赖静态启发式或随机搜索,使其在面对先进的安全对齐时显得脆弱。为了解决这一问题,我们引入了 Metis,这是一个将越狱攻击重新表述为对抗性部分可观测马尔可夫决策过程(POMDP)中推理时策略优化的框架。Metis 采用自演化元认知循环对目标防御逻辑进行因果诊断,并利用结构化反馈作为语义梯度来优化其策略,通过透明的推理轨迹提供增强的可解释性。在 10 个不同模型上的广泛评估表明,Metis 在对比方法中实现了最高的平均攻击成功率(ASR),达到 89.2%,并在具有弹性的前沿模型上保持高效(例如,O1 上为 76.0%,GPT-5-chat 上为 78.0%),而传统基线在这些模型上表现出显著的性能下降。通过用定向优化取代冗余探索,Metis 将 token 成本平均降低了 8.2 倍,最高达 11.4 倍。我们的分析表明,在测试设置下,当前防御仍然容易受到内部引导的闭环推理轨迹的攻击,突显了下一代防御在推理期间动态推理安全性的关键需求。
引用
@article{arxiv.2605.10067,
title = {Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization},
author = {Huilin Zhou and Jian Zhao and Yilu Zhong and Zhen Liang and Xiuyuan Chen and Yuchen Yuan and Tianle Zhang and Chi Zhang and Lan Zhang and Xuelong Li},
journal= {arXiv preprint arXiv:2605.10067},
year = {2026}
}
备注
Accepted to the 43rd International Conference on Machine Learning (ICML 2026)