中文

AI 可解释性中的死鱼

人工智能 2025-12-23 v1

摘要

在一项惊人的神经科学研究中,作者将一只死鱼置于 MRI 扫描仪中,并让其观看包含人类在社交情境中所处姿势的图像。惊讶地,标准分析报告中预测社交情感的脑区时,竟然发现了类似现象。当然,解释并非超自然认知,而是关于误用统计推断的警示故事。在 AI 可解释性领域,类似的“死鱼”artifact 屡见不鲜:特征归因、探测、稀疏自编码甚至因果分析都可能为随机初始化的神经网络生成看似合理的解释。本文审视了这一现象,主张一种务实的统计-因果重构:计算系统的解释应被视为(统计)模型的参数,从计算痕迹中推断出来。这一视角超越了仅衡量因有限抽样输入数据导致的解释统计波动;可解释性方法成为统计估计量,结果应针对明确且有意义的备择计算假设进行测试,并依据所假设的统计模型对不确定性进行量化。这一观点还突显了一些重要的理论问题,例如常见可解释性查询的可识别性,我们认为这一问题至关重要,以理解该领域对虚假发现、poor generalizability 以及高方差的脆弱性。更广泛地,将可解释性置于统计推断标准工具箱中,为未来工作开辟了以务实且严谨的科学方式实现 AI 可解释性的有前景的道路。

关键词

引用

@article{arxiv.2512.18792,
  title  = {The Dead Salmons of AI Interpretability},
  author = {Maxime Méloux and Giada Dirupo and François Portet and Maxime Peyrard},
  journal= {arXiv preprint arXiv:2512.18792},
  year   = {2025}
}

备注

10 pages, 3 figures