关于人工智能对齐不可判定性: halt 的机器
人工智能
2024-08-20 v1
摘要
内部对齐问题断言,任意人工智能 (AI) 模型在给定其输入的情况下是否满足其输出的非平凡对齐函数是不可判定的。这一论点由 Rice 定理严格证明,也等价于归约到图灵停机问题,本文还呈现了该证明的概要。尽管如此,有一可枚举的已证明对齐 AI 集合,这些 AI 是由有限的已证明对齐操作构成。因此,我们认为,对齐应作为 AI 架构的必然属性,而非对任意 AI 模型后置施加的特征。此外,尽管外部对齐问题是定义捕获人类价值和偏好的评估函数,但我们提出此类函数还必须施加停机约束,保证 AI 模型在有限执行步骤内始终到达终止状态。本文提供的示例和模型说明了这一约束及其涉及的复杂挑战,为采用一种内在刚性对齐的人工智能系统架构提供了有说服力的依据,该架构确保停机。
引用
@article{arxiv.2408.08995,
title = {On the Undecidability of Artificial Intelligence Alignment: Machines that Halt},
author = {Gabriel Adriano de Melo and Marcos Ricardo Omena De Albuquerque Maximo and Nei Yoshihiro Soma and Paulo Andre Lima de Castro},
journal= {arXiv preprint arXiv:2408.08995},
year = {2024}
}
备注
Submitted for the Scientific Reports AI Alignment Collection