论智能与判断的不可分离性:AI 对齐中的过滤计算不可行性
人工智能
2025-07-11 v1 密码学与安全
摘要
随着大型语言模型(LLM)的广泛部署,一个关注点是其潜在被用于生成有害内容的风险。我们的工作聚焦于对齐挑战,特别是关注防止生成不安全信息的过滤器。两种自然的干预点是对输入提示进行过滤以防止其到达模型,或在生成后对输出进行过滤。我们的主要结果表明,对输入和输出进行过滤都面临计算挑战。首先,我们展示存在若干 LLM 其不存在高效的提示过滤器:对这些模型而言,能够诱导有害行为的对抗性提示可以轻易构造,且对任何高效过滤器而言这些提示与良性提示在计算上不可区分。我们的第二个主要结果识别了一个自然情境下输出过滤的计算不可判性。我们的所有分离结果都基于密码学硬度假设。除上述核心发现外,我们还形式化并研究了放宽的缓解方法,进一步显示了计算障碍。我们指出,安全性无法通过设计外部于 LLM 内部(架构和权重)的过滤器来实现;特别是,对 LLM 的黑盒访问方式将不足以实现对齐。基于我们的技术结果,我们认为对齐型 AI 系统的智能与其判断不可分割。
引用
@article{arxiv.2507.07341,
title = {On the Impossibility of Separating Intelligence from Judgment: The Computational Intractability of Filtering for AI Alignment},
author = {Sarah Ball and Greg Gluch and Shafi Goldwasser and Frauke Kreuter and Omer Reingold and Guy N. Rothblum},
journal= {arXiv preprint arXiv:2507.07341},
year = {2025}
}