中文

神经多样性可影响性作为 AI 对齐问题的条件性解决方案

人工智能 2025-07-25 v4

摘要

AI 对齐问题聚焦于确保人工智能(AI)系统(包括 AGI 和 ASI)按照人类价值观行事,面临着深刻挑战。随着从窄 AI 向通用人工智能(AGI)和超级智能的推进,对控制和生存风险的担忧不断升级。本文探讨了拥抱不可避免的 AI 偏差是否可以作为一项条件性策略,通过培育竞争代理的动态生态系统来引导其朝向更符合人类利益的趋势发展并缓解风险。我们探讨了偏差如何能够并应当被促进为一种平衡机制,与最符合人类利益的代理结盟,确保没有任何单一系统造成破坏性主导。本研究的主要前提是偏差是不可避免的,因为从图灵完备系统来看,完全的 AI-人类对齐在数学上是不可能的,我们也在本文中提供了这一证明,该特征随后被继承到 AGI 和 ASI 系统中。我们引入了一种基于扰动和干预分析的意见改变攻击测试,用于研究人类和代理如何通过合作与竞争改变或中和友好和不友好的 AI。我们表明开放模型更加多样化,而专有模型中实施的大多数护栏在控制代理行为范围方面是成功的,但会产生正面和负面后果,而封闭系统更易于引导,也可用于对抗专有 AI 系统。我们还表明人类和 AI 干预会产生不同的影响,因此暗示了多种策略。

关键词

引用

@article{arxiv.2505.02581,
  title  = {Neurodivergent Influenceability as a Contingent Solution to the AI Alignment Problem},
  author = {Alberto Hernández-Espinosa and Felipe S. Abrahão and Olaf Witkowski and Hector Zenil},
  journal= {arXiv preprint arXiv:2505.02581},
  year   = {2025}
}

备注

44 pages