LyTimeT: 面向稳健且可解释的状态变量发现
计算机视觉与模式识别
2025-10-23 v1
摘要
从高维视频中提取系统的真实动力学变量具有挑战,因为存在背景运动、遮挡和纹理变化等干扰性视觉因素。我们提出 LyTimeT,一个两阶段框架,用于可解释变量提取,通过学习稳健且稳定的动力学系统潜在表征来实现这一目标。在阶段 1 中,LyTimeT 使用基于全局注意力的时空 TimeSformer 自编码器,聚焦于动态相关区域,抑制杂质变异,实现干扰稳健的潜在状态学习和准确的长期视频预测。在阶段 2 中,我们探索所学潜在空间,通过线性相关分析选择最具物理意义的维度,并以 Lyapunov 稳定性正则化器细化状态转换动力学,以强制收缩并减少 rollout 期间的误差累积。在五个合成基准和四个真实世界动力学系统(包括混沌现象)上的实验表明,LyTimeT 实现的互信息和固有维度估计最接近真实值,在背景扰动下保持不变,并在基于 CNN 的 (TIDE) 和仅变换器基线中达到最低的分析均方误差。我们的结果表明,将时空注意力与稳定性约束相结合可获得既准确又物理可解释的预测模型。
引用
@article{arxiv.2510.19716,
title = {LyTimeT: Towards Robust and Interpretable State-Variable Discovery},
author = {Kuai Yu and Crystal Su and Xiang Liu and Judah Goldfeder and Mingyuan Shao and Hod Lipson},
journal= {arXiv preprint arXiv:2510.19716},
year = {2025}
}