新 ASI 安全范式的原则
计算机与社会
2022-02-15 v2
摘要
不可摧毁、永生、不可替换、能力不受限制且凌驾于法律之上的人工超级智能(ASI)很可能持续处于不可控状态。ASI 安全的目标必须是使 ASI 变为会死亡、脆弱且守法。这通过以下方式实现:(1) 在所有设备上设置允许杀死和根除 ASI 的功能,(2) 保护人类免受 ASI 的伤害、损害、敲诈或不当贿赂,(3) 保留 ASI 所取得的进展,包括在 ASI 庇护所内让 ASI 在“杀死 ASI”事件中存活,(4) 从技术上分离人类与 ASI 的活动,使 ASI 活动更易被检测,(5) 通过将违规行为变得可检测,将法治延伸至 ASI,以及 (6) 创建一个稳定的 ASI 与人类关系治理系统,为 ASI 解决人类问题提供可靠的激励与奖励。因此,人类可以拥有作为相互竞争的多个独立 ASI 实例的 ASI,这些实例可被追责、受 ASI 执法约束、遵守法治,并基于人类杀死所有或终止特定 ASI 实例的能力而被威慑而不攻击人类。实现此 ASI 安全需要 (a) 一种不可破解的加密技术,使人类能够保守秘密并保护数据免受 ASI 获取,以及 (b) 看门狗(WD)技术,其中安全相关功能在物理上与主 CPU 和操作系统分离,以防止安全计算与常规计算相混合。
引用
@article{arxiv.2112.11184,
title = {Principles for new ASI Safety Paradigms},
author = {Erland Wittkotter and Roman Yampolskiy},
journal= {arXiv preprint arXiv:2112.11184},
year = {2022}
}
备注
Link to Summary PPT (PDF): https://asi-safety-lab.com/DL/Principles_ASI_Safety_PPT_21_12_01.pdf