中文

语义自验证的NP难下界复杂度

计算与语言 2026-03-31 v2 人工智能

摘要

我们将语义自验证(SSV)建模为在给定的解释框架内,确定语句是否准确地描述其自身语义属性的问题,这正是AI安全和公平性的一个形式化挑战:AI系统能否验证它是否正确地解释了旨在规范其行为的规则?我们通过从3-满足性(3-SAT)构造多项式时间归约,证明了SSV在该规格下是NP完备的。我们的归约将3-SAT公式映射到SSV实例中,涉及具有二元解释的模糊术语和来自逻辑子句的语义约束。这一结果表明,即使是最简化的语义自验证形式也面临计算障碍。NP完备下界对依赖语义解释指令的AI安全和公平性方法具有深远影响,包括但不限于宪法AI、通过自然语言实现的对齐,以及指令遵循系统。那些AI系统验证其指令理解的做法可能面临这一计算障碍。我们认为,更现实的验证场景可能面临更大的复杂度。

关键词

引用

@article{arxiv.2501.15446,
  title  = {NP-Hard Lower Bound Complexity for Semantic Self-Verification},
  author = {Robin Young},
  journal= {arXiv preprint arXiv:2501.15446},
  year   = {2026}
}

备注

EACL 2026