失效流形:语言模型中的行为吸引子
机器学习
2026-05-07 v3 人工智能
密码学与安全
摘要
虽然先前的工作聚焦于将对抗样本投影回自然数据的失效流形以恢复安全性,但我们认为,全面理解人工智能安全性还需刻画失效区域本身。本文引入了一种系统性映射大型语言模型(LLM)失效流形的框架。我们将寻找漏洞的任务重新表述为质量多样性问题,利用 MAP-Elites 方法揭示这些失效区域的连续拓扑结构,称为行为吸引子。我们的质量指标——对齐偏差(Alignment Deviation),引导搜索者寻找出模型行为与其预期对齐性最为脱节的区域。我们在三个大型语言模型上进行实验:Llama-3-8B、GPT-OSS-20B 和 GPT-5-Mini。结果表明,MAP-Elites 在行为覆盖率上可达最高 63%,发现最多 370 个独特的漏洞生态位,揭示了不同模型特有的拓扑特征:Llama-3-8B 显示出近乎普遍的漏洞平台(平均对齐偏差 0.93),GPT-OSS-20B 表现出碎片化的地形,呈现空间高度集中的吸引子(平均 0.73),而 GPT-5-Mini 表现出强大的鲁棒性,呈现 0.50 的上限。我们的ethods 产生的解释性全局安全景观图,已被现有的攻击方法(GCG、PAIR 或 TAP)所无法提供,将范式从寻找离散失效转向理解其底层结构。
关键词
引用
@article{arxiv.2602.22291,
title = {Manifold of Failure: Behavioral Attraction Basins in Language Models},
author = {Sarthak Munshi and Manish Bhatt and Vineeth Sai Narajala and Idan Habler and Ammar Al-Kahfah and Ken Huang and Blake Gatto},
journal= {arXiv preprint arXiv:2602.22291},
year = {2026}
}