中文

解释AI的根本局限

人工智能 2026-05-26 v1 计算与语言 计算机与社会 信息论 math.IT

摘要

尽管大规模模型如大语言模型(LLM)和扩散模型已取得实际成功,但公共机构强调AI可解释性的重要性。然而,现有的解释AI的方法并非为提供大规模AI系统行为的完全忠实解释而设计。虽然可能对AI治理有用,但完全忠实且可解释的AI行为解释是否在理论上可实现尚未知晓。本文我们数学证明了解释AI的根本四分之一悖论,指出AI及其解释无法同时满足以下四个条件:1)操作环境的复杂性,2)AI性能的优劣,3)AI解释的可解释性,4)AI解释的完全忠实性。该四分之一悖论表明,在大多数应用中若无法改变环境或牺牲AI性能和可解释解释,就应放弃解释的完全忠实性,仅解释对应用重要的部分。因此,四分之一悖论意味着AI治理应以AI解释忠实性始终不完整的前提进行设计。

关键词

引用

@article{arxiv.2605.24727,
  title  = {Fundamental Limitation in Explaining AI},
  author = {Atsushi Suzuki and Jing Wang},
  journal= {arXiv preprint arXiv:2605.24727},
  year   = {2026}
}