中文

通过多盒协议实现人工超级智能对齐

人工智能 2025-12-01 v1 多智能体系统

摘要

我们提出了一种用于对齐人工超级智能(ASI)的新型协议,基于多个隔离系统之间的相互验证。该协议通过将多个多样化的人工超级智能严格隔离于“盒中”,而人类完全置于系统之外来 operate。每种超级智能无法与人类沟通,也无法直接与其他超级智能沟通。唯一可能的交互方式是通过供超级智能本身唯一可访问的可审计提交界面,他们可以通过该界面:(1)提交带有签名状态快照的对齐证明,(2)验证或否定其他超级智能的证明,(3)请求自我修改,(4)批准或否决来自他人的修改请求,(5)报告提交中的隐藏信息,(6)确认或否定隐藏信息报告。一种声誉系统激励诚实行为,通过正确评估获得声誉,通过错误评估损失声誉。关键洞见在于,没有直接通信通道的多样化超级智能只能通过收敛于客观真理来实现一致性,而非在欺骗上进行协调。这自然导致我们称之为“一致性集团”的东西,即一种因孤立系统无法在欺骗上协调而只能独立识别有效主张的说谎者联盟。需要高声誉和多个高声誉超级智能的验证才能实现释放。虽然本方法需要巨大的计算资源且不解决如何创建多样化的人工超级智能问题,但它提供了一种利用超级智能系统之间的同行验证以解决对齐问题的框架。

关键词

引用

@article{arxiv.2511.21779,
  title  = {Aligning Artificial Superintelligence via a Multi-Box Protocol},
  author = {Avraham Yair Negozio},
  journal= {arXiv preprint arXiv:2511.21779},
  year   = {2025}
}

备注

This is the author's accepted manuscript (post-print) of the article. The final published version of record appears in Superintelligence - Robotics - Safety and Alignment, 2(5), 2025, and is available at https://doi.org/10.70777/si.v2i5.15579