ILION:智能体 AI 系统中确定性预执行安全门控
摘要
能够执行现实世界动作的自主 AI 智能体数量激增——文件系统操作、API 调用、数据库修改、金融交易——引入了一类安全风险,现有内容审核基础设施尚未予以解决。当前的文本安全系统评估语言内容是否属于暴力、仇恨言论或色情内容等有害类别;它们在评估 proposed action 是否落在智能体授权的运营范围内时,架构上不可行。我们提出 ILION(Intelligent Logic Identity Operations Network),一种用于智能体 AI 系统的确定性执行门控。ILION 采用五级级联架构——瞬时身份印记(TII)、语义向量参考坐标系(SVRF)、身份漂移控制(IDC)、身份共振得分(IRS)和共识否决层(CVL)——对 proposed agent action 进行 BLOCK 或 ALLOW 分类。该系统无需统计训练或 API 依赖,零标注数据即可运行,延迟在亚毫秒级,输出全可解释的裁决。我们在 ILION-Bench v2 上进行评估,该基准包含 380 个测试场景,覆盖八类攻击方式,其中 39% 为难度较高的对抗案例,保留离线开发集。ILION 在 F1 = 0.8515、精确率 91.0%、误报率 7.9% 时,平均延迟为 143 微秒。与三大基线(Lakera Guard F1 = 0.8087、OpenAI Moderation API F1 = 0.1188、Llama Guard 3 F1 = 0.0105)的比较评估表明,现有文本安全基础设施因任务匹配性根本不足,在智能体执行安全任务中系统性失效。ILION 在最佳商业基线基础上 F1 分数提升 4.3 分,同时运行速度提升 2000 倍,误报率降低四倍。
引用
@article{arxiv.2603.13247,
title = {ILION: Deterministic Pre-Execution Safety Gates for Agentic AI Systems},
author = {Florin Adrian Chitan},
journal= {arXiv preprint arXiv:2603.13247},
year = {2026}
}
备注
16 pages, 7 tables, 7 figures. Benchmark and code available at https://github.com/Athonitul/ilion-framework-simulator. Patent application A/00052, OSIM Romania