中文

AI安全门中分类与验证二元性的经验验证

机器学习 2026-04-02 v1 人工智能 机器学习

摘要

基于分类器的安全门能否在AI系统经过数百次迭代改进的过程中保持可靠的监督?我们提供了全面的经验证据,表明它们不能。在自改进神经控制器(d=240)上,十八种分类器配置——涵盖MLP、SVM、随机森林、k-NN、贝叶斯分类器和深度网络——均未能满足安全自改进的双重条件。三种安全RL基线(CPO、Lyapunov、safety shielding)同样失败。结果扩展至MuJoCo基准测试(Reacher-v4 d=496,Swimmer-v4 d=1408,HalfCheetah-v4 d=1824)。在受控分布分离度高达delta_s=2.0的条件下,所有分类器仍然失败——包括NP最优测试和训练准确率达100%的MLP——证明了结构性不可能性。随后我们证明该不可能性特定于分类,而非安全自改进本身。一个利普希茨球验证器在维度d∈{84, 240, 768, 2688, 5760, 9984, 17408}上实现了零误接受,使用可证明的分析界(无条件delta=0)。球链技术实现了无界参数空间遍历:在MuJoCo Reacher-v4上,10条链在delta=0下带来+4.31的奖励提升;在Qwen2.5-7B-Instruct进行LoRA微调期间,42次链转移遍历了单球半径的234倍,200步内零安全违规。50条提示的预言机确认了预言机无关性。组合式逐组验证可实现半径达全网络球的37倍。在d≤17408时,delta=0是无条件的;在LLM规模下,条件于估计的利普希茨常数。

关键词

引用

@article{arxiv.2604.00072,
  title  = {Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates},
  author = {Arsenios Scrivens},
  journal= {arXiv preprint arXiv:2604.00072},
  year   = {2026}
}

备注

21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451