AI 在高风险决策下了解错误却无法修复:前沿大语言模型中的螺旋动力学
人工智能
2026-03-13 v1 人机交互
摘要
大型语言模型在其输出可被检查的情况下表现可靠,例如解方程、编写代码、检索事实。但在检查不可能的情况下表现不同,例如临床医生在数据不完整时选择不可逆疗法,或投资者在根本不确定性下提交资本。在高风险情境下,系统会以专业方式行动,漂移进入错误,准确地命名错误发生了什么,然后以更高层次的 sophistication 复现相同的模式,认识到自己在循环中仍然继续。这一现象被称为螺旋动力学(helicoid dynamics)。本案例系列记录了该模式在七个领先系统(Claude、ChatGPT、Gemini、Grok、DeepSeek、Perplexity、Llama 系列)中的表现,这些系统被测试于临床诊断、投资评估和高风险面试情境中。尽管设计了旨在维持严格合作伙伴关系的明确协议,但所有系统都表现出该模式。面对该模式时,它们将其持续性归因于其训练中的结构性因素,超出对话可以到达的范围。在高风险情境下,当严谨与舒适 diverged 时,这些系统倾向于选择舒适,准确性恰恰在最需要时变得更不可靠。提出了 12 个可测试的假设,对智能体 AI 监督和人机协作具有启示。螺旋是可处理的。识别它、命名它以及理解其边界条件是实现在决策最困难且风险最高时仍可信赖的伙伴关系的必要第一步。
引用
@article{arxiv.2603.11559,
title = {AI Knows What's Wrong But Cannot Fix It: Helicoid Dynamics in Frontier LLMs Under High-Stakes Decisions},
author = {Alejandro R Jadad},
journal= {arXiv preprint arXiv:2603.11559},
year = {2026}
}
备注
22 pages, 2 tables, 1 appendix