基于柯尔莫哥洛夫复杂度的 AI 安全验证的不完备性
人工智能
2026-04-07 v1
摘要
确保人工智能(AI)系统满足形式化安全与策略约束是安全关键领域的核心挑战。虽然验证的局限性通常归因于组合复杂性和模型表达能力,但我们表明它们源于内在的信息论极限。我们将策略合规性形式化为对编码系统行为的验证问题,并使用柯尔莫哥洛夫复杂度对其进行分析。我们证明了一个不完备性结果:对于任意固定的、可计算枚举的健全验证器,存在一个阈值,一旦其复杂度超过该阈值,真正的策略合规实例就无法被认证。因此,任何有限的形式化验证器都无法认证任意高复杂度的所有策略合规实例。这揭示了 AI 安全验证的一个基本局限性,独立于计算资源,并推动了提供实例级正确性保证的证明携带方法。
引用
@article{arxiv.2604.04876,
title = {Incompleteness of AI Safety Verification via Kolmogorov Complexity},
author = {Munawar Hasan},
journal= {arXiv preprint arXiv:2604.04876},
year = {2026}
}