中文

PRISM风险信号框架:基于层次结构的人工智能行为风险红线

人工智能 2026-04-14 v1

摘要

当前的人工智能安全方法在案例层面上定义红线:特定提示、特定输出、特定危害。本文认为,红线可以更根本地设置——在人工智能推理所控制的价值、证据和信息源层次结构层面。使用PRISM(Profile-based Reasoning Integrity Stack Measurement)框架,我们定义了从人工智能系统如何优先处理价值(L4)、如何加权证据类型(L3)以及如何信任信息来源(L2)的结构性异常中派生出的27种行为风险信号。每个信号都通过结合绝对排名位置和相对获胜率间隙的双阈值原则进行评估,产生两种分类(已确认风险 vs. 观察信号)。层次化方法相对于案例特定红线具有三个优势:它具有预防性(在产生有害输出之前检测危险推理结构)、综合性(单个价值层次信号涵盖无限数量的案例特定违规)以及可衡量性(基于经验强制选择数据)。我们使用来自7个人工智能模型、跨越三个权威栈层的约39.7万个强制选择响应,展示了框架的检测能力,证明了该信号分类成功地区分了结构极端模型、情境依赖风险模型以及平衡层次模型。

关键词

引用

@article{arxiv.2604.11070,
  title  = {PRISM Risk Signal Framework: Hierarchy-Based Red Lines for AI Behavioral Risk},
  author = {Seulki Lee},
  journal= {arXiv preprint arXiv:2604.11070},
  year   = {2026}
}

备注

13 pages, 13 tables, 1 appendix