超越黑箱:基于因果最小性的生成模型可辨识解释与控制
机器学习
2026-04-03 v2
摘要
深度生成模型虽然在图像和文本生成等领域取得了突破,但大多以黑箱形式运作,阻碍了人类的理解、控制与对齐。虽然稀疏自编码器(sparse autoencoders, SAEs)在实证上取得了显著成功,但往往缺乏理论保障,风险在于主观的洞见。我们的主要目标是为可解释的生成模型建立一套原则化的基础。我们展示,因果最小性原则——即偏好最简单的因果解释——能够赋予现代生成模型的潜在表征以清晰的因果解释和稳健、按组件可辨识的控制。我们引入了一种新的理论框架,用于分层选择模型,其中高层概念从受约束的低层变量组合而来,更好地捕捉数据生成中的复杂依赖关系。在理论推导的最小性条件下,我们展示,学习到的表征可以等价于数据生成过程的真实潜在变量。实验方面,我们将这些约束应用于主流文本到图像扩散模型,能够提取其内在的分层概念图谱,为其内部知识组织提供新的洞见。此外,这些基于因果的概念可作为精细模型操控的杠杆,为透明可靠的系统铺路。
引用
@article{arxiv.2512.10720,
title = {Beyond the Black Box: Identifiable Interpretation and Control in Generative Models via Causal Minimality},
author = {Lingjing Kong and Shaoan Xie and Guangyi Chen and Yuewen Sun and Xiangchen Song and Eric P. Xing and Kun Zhang},
journal= {arXiv preprint arXiv:2512.10720},
year = {2026}
}