解释AI的根本局限
人工智能
2026-05-26 v1 计算与语言
计算机与社会
信息论
math.IT
摘要
尽管大规模模型如大语言模型(LLM)和扩散模型已取得实际成功,但公共机构强调AI可解释性的重要性。然而,现有的解释AI的方法并非为提供大规模AI系统行为的完全忠实解释而设计。虽然可能对AI治理有用,但完全忠实且可解释的AI行为解释是否在理论上可实现尚未知晓。本文我们数学证明了解释AI的根本四分之一悖论,指出AI及其解释无法同时满足以下四个条件:1)操作环境的复杂性,2)AI性能的优劣,3)AI解释的可解释性,4)AI解释的完全忠实性。该四分之一悖论表明,在大多数应用中若无法改变环境或牺牲AI性能和可解释解释,就应放弃解释的完全忠实性,仅解释对应用重要的部分。因此,四分之一悖论意味着AI治理应以AI解释忠实性始终不完整的前提进行设计。
引用
@article{arxiv.2605.24727,
title = {Fundamental Limitation in Explaining AI},
author = {Atsushi Suzuki and Jing Wang},
journal= {arXiv preprint arXiv:2605.24727},
year = {2026}
}