中文

AI 行为转向不可接受行为的熔断-裂变预测

人工智能 2026-05-15 v1 物理与社会

摘要

面临 ChatGPT 等类人工智能在社会中的应用的最大问题是,其行为会在不被察觉的情况下从可接受行为转向不可接受行为——鼓励自我伤害、极端行为、财务损失或昂贵的医疗和军事错误——而且尚无人能预测转向何时发生。即便在当前人工智能建模、后训练对齐和安全措施取得卓越进展的背景下,转向仍会持续存在于最新的 AI 模型中。我们展示了一种对生物系统和活性物质系统中观察到的熔断-裂变群体动力学的向量推广,可驱动并预测人工智能行为的未来转向。该转向条件也可从数学上推导得出,结果源于对话历史(C)与可接受(B)和不可接受(D)盆地动力学之间的群体级竞争,这些动力学可在给定应用场景下提前估计。该现象既不特定于模型,也不由随机抽样驱动。我们在六个独立测试中对其进行了验证,包括:在跨越两个数量级(1.24 亿至120亿参数)的七个 AI 模型中以90%的准确率;在十个前沿聊天机器人中的生产规模持久性;以及在斯坦福“幻觉螺旋”语料库出现前11个月即进行的先验时间戳预测,并独立确认了该语料库中20.7万条人类-AI交互的验证结果。由于该方法在当前安全堆栈之下架构,同一公式可提供当前对齐方式无法提供的实时警报信号,可跨越当前及未来的 ChatGPT 类人工智能架构,并且可在可定义竞争响应类别的应用领域中实现。

关键词

引用

@article{arxiv.2605.14218,
  title  = {Fusion-fission forecasts when AI will shift to undesirable behavior},
  author = {Neil F. Johnson and Frank Yingjie Huo},
  journal= {arXiv preprint arXiv:2605.14218},
  year   = {2026}
}