非理性机器:算法安全的神经症与极限
人工智能
2025-10-14 v1 神经与进化计算
机器人学
摘要
我们提出了一种用于表征具象化 AI 中神经症的框架:这些行为在内部是连贯的,但与现实不一致,源于规划、不确定性处理和厌恶记忆之间的相互作用。在一个网格导航堆栈中,我们记录了包括翻转-翻转、计划颤动、反复执着循环、瘫痪和 hypervigilance(过度警觉)、无效搜索、信念不一致、tie break 颤动、走廊颤动、最优执着、度量不匹配、策略振荡和有限视野变体在内的常见模式。对于每一种模式,我们提供轻量级在线检测器和可重用的逃逸策略(短期承诺、切换容差、平滑、原则性仲裁)。我们随后表明,即使在完全可见的情况下,学习的厌恶成本主导局部选择,仍可导致持久的惊恐回避,尽管存在全局安全路径,仍会产生长时间的绕行。我们将第一/第二/第三定律作为工程术语分别指代安全延迟、命令遵从和资源效率,我们认为局部修复是不够的;全局失效可能仍然存在。为揭示这些问题,我们提出基于遗传编程的破坏性测试,通过进化世界和扰动来最大化法律压力和神经症评分,产生对抗性课程和反事实跟踪,以暴露在架构性修复,而仅限于症状级补丁所必需的地方。
引用
@article{arxiv.2510.10823,
title = {The Irrational Machine: Neurosis and the Limits of Algorithmic Safety},
author = {Daniel Howard},
journal= {arXiv preprint arXiv:2510.10823},
year = {2025}
}
备注
41 pages, 17 figures, 5 tables