大型AI模型的机理理解与验证:SemanticLens
机器学习
2025-01-10 v1 人工智能
摘要
与飞机等人类工程系统不同——其中每个组件的作用和依赖关系都得到了充分理解——AI模型的内部运作在很大程度上仍然不透明,阻碍了可验证性并削弱了信任。本文介绍了SemanticLens,一种通用的神经网络解释方法,它将组件(例如单个神经元)编码的隐藏知识映射到基础模型(如CLIP)的语义结构化多模态空间中。在这个空间中,独特的操作成为可能,包括:(i) 文本搜索以识别编码特定概念的神经元,(ii) 模型表示的系统分析与比较,(iii) 神经元的自动标注及其功能角色的解释,以及(iv) 审计以验证决策是否符合要求。SemanticLens完全可扩展且无需人工输入,被证明在调试和验证、总结模型知识、使推理与期望对齐(例如在黑色素瘤分类中遵守ABCDE规则)以及检测与虚假相关性及其相关训练数据相关的组件方面是有效的。通过实现组件级别的理解和验证,所提出的方法有助于弥合AI模型与传统工程系统之间的“信任差距”。我们在https://github.com/jim-berend/semanticlens上提供SemanticLens的代码,并在https://semanticlens.hhi-research-insights.eu上提供演示。
引用
@article{arxiv.2501.05398,
title = {Mechanistic understanding and validation of large AI models with SemanticLens},
author = {Maximilian Dreyer and Jim Berend and Tobias Labarta and Johanna Vielhaben and Thomas Wiegand and Sebastian Lapuschkin and Wojciech Samek},
journal= {arXiv preprint arXiv:2501.05398},
year = {2025}
}
备注
74 pages (18 pages manuscript, 7 pages references, 49 pages appendix)