中文

认知闭合与不对齐的不可逆性:对齐创新系统性障碍的建模

人工智能 2025-04-04 v1

摘要

确保通用人工智能(AGI)安全发展的努力通常依赖于基于公理化形式主义、可解释性和经验验证的共识对齐方法。然而,这些方法可能在结构上无法识别或纳入超出其公认认知框架的新颖解决方案。本文引入了一个认知闭合的功能模型,其中认知、制度、社会和基础设施过滤器共同作用,使得许多对齐提案对现有评估系统变得不可读。我们提出了一个由理论和经验来源共同支持的加权闭合模型,包括由 AI 系统对拒绝和不参与去中心化集体智能(DCI)框架的模式进行的元分析。我们认为,评估像 DCI 这样的模型的递归失败不仅是一个社会学上的疏忽,更是一种结构性吸引子,映射了我们旨在 AGI 中避免的不对齐风险本身。如果不采用 DCI 或类似的认知纠正递归模型,我们可能正走在一条通往不可逆不对齐的可预测道路上。本文的开发和接受过程,首先通过模拟评审然后通过正式渠道,为支持其核心主张提供了案例研究:认知闭合只能通过对维持它的约束进行递归建模来克服。

关键词

引用

@article{arxiv.2504.02058,
  title  = {Epistemic Closure and the Irreversibility of Misalignment: Modeling Systemic Barriers to Alignment Innovation},
  author = {Andy Williams},
  journal= {arXiv preprint arXiv:2504.02058},
  year   = {2025}
}