MOSAIC:基于稀疏可识别因果学习的模块发现,用于科学时间序列
机器学习
2026-05-08 v1 人工智能
摘要
因果表征学习(CRL)旨在恢复具有可识别性保证的潜在变量,通常在恰当假设下仅限于置换和分量级参数化。然而,可识别性并不等同于可解释性:潜在语义通常通过与已知真实因子对齐后才被赋予。这一限制在科学时间序列中尤为突出,因为潜在机制未知,发现可解释结构是主要目标。相比之下,科学观测(如残基-配对距离、气候指数或过程传感器)是内在语义的,因它们对应于命名的物理量。这引出一个关键问题:可解释性的观察能否传递到可识别的潜在空间中?我们提出MOSAIC(Module discovery via Sparse Additive Identifiable Causal learning),一种稀疏时序变分自编码器,将时序CRL可识别性与对观察变量的支持恢复相结合。MOSAIC通过准则条件的时间变化识别潜在变量,并通过加法解码器为每个潜在变量恢复一组稀疏关联观察,实现模块级可解释性。我们证明,方差分解(ANOVA)主效应在一般光滑混合函数下是可识别的,并为可行的稀疏加法变体提供有限样本恢复保证。实验上,MOSAIC在RNA分子动力学、太阳风、ENSO气候、田纳东曼过程以及合成托马克基基准测试中恢复领域一致的变量组,使科学时间序列中可解释潜在机制的发现成为可能。
引用
@article{arxiv.2605.05524,
title = {MOSAIC: Module Discovery via Sparse Additive Identifiable Causal Learning for Scientific Time Series},
author = {Shicheng Fan and Nour Elhendawy and Jianle Sun and Ke Fang and Kun Zhang and Yihang Wang and Lu Cheng},
journal= {arXiv preprint arXiv:2605.05524},
year = {2026}
}