我们能在人工智能上测试意识理论吗?消除法、指标与鲁棒性
人工智能
2025-12-23 v1
摘要
寻找可靠意识指示器的研究已分裂为多个交织的理论阵营(全球工作区理论(GWT)、集成信息理论(IIT)和高阶理论(HOT)),每种理论提出不同的神经信号。我们采用合成神经现象学方法:构建构成这些机制的人工智能体,以通过不可在生物系统中实现的精确结构消除来测试其功能后果。通过三个实验,我们报告了各种消除现象,表明这些理论描述的是互补的功能层面而非相互竞争的account。在实验1中,无需重连的自模型损伤消除了元认知校准,同时保留了一级任务性能,产生与HOT预测相符的合成隐睡类比。在实验2中,工作区容量在信息获取中起因果必需作用:完全工作区损伤导致与访问相关指标出现质变崩溃,而部分减小表现出分级退化,与GWT的点火框架相符。在实验3中,我们发现广播-放大效应:GWT式广播放大内部噪声,造成极端脆弱性。B2代理家族对相同的潜在扰动具有鲁棒性;这种鲁棒性在无自模型/工作区只读控制中仍然存在,警示不要将该效应仅归因于压缩。我们还报告了一个明确的负结果:在工作区瓶颈下,原始扰动复杂度(PCI-A)降低,这警示不要对IIT相邻的代理指标进行机械迁移。这些结果表明存在一种层次设计原则:GWT提供广播容量,而HOT提供质量控制。我们强调,我们的代理并不具备意识;它们是用于测试意识理论功能预测的参考实现。
引用
@article{arxiv.2512.19155,
title = {Can We Test Consciousness Theories on AI? Ablations, Markers, and Robustness},
author = {Yin Jun Phua},
journal= {arXiv preprint arXiv:2512.19155},
year = {2025}
}