DIFFUMA:基于双路径Mamba和扩散增强的高保真时空视频预测
计算机视觉与模式识别
2025-07-10 v1 人工智能
摘要
时空视频预测在天气预报到工业自动化等关键领域发挥着关键作用。然而,在如半导体制造等高精度工业场景中,缺乏专门的基准数据集严重阻碍了对复杂过程的建模和预测。为解决这一挑战,我们做了两方面的贡献。首先,我们构建并发布了Chip Dicing Lane Dataset(CHDL),这是第一个专为半导体晶圆切割工艺提供的公共时序图像数据集。通过工业级视觉系统捕获,CHDL为高保真过程建模、缺陷检测和数字孪生体开发提供了迫切需要且充满挑战性的基准。其次,我们提出DIFFUMA,一种专为此类细粒度动态特性设计的双路径预测架构。该模型通过平行的Mamba模块捕获全局长程时序上下文,同时利用由时序特征引导的扩散模块恢复和增强细粒度空间细节,有效抵御特征退化。实验表明,在我们的CHDL基准上,DIFFUMA显著优于现有方法,均方误差(MSE)降低39%,结构相似性(SSIM)从0.926提升至近乎完美的0.988。这种卓越的性能也适用于自然现象数据集。我们的工作不仅提供了新的状态(SOTA)模型,更重要的是为社区提供了一个珍贵的数据资源,以推动工业AI的未来研究。
引用
@article{arxiv.2507.06738,
title = {DIFFUMA: High-Fidelity Spatio-Temporal Video Prediction via Dual-Path Mamba and Diffusion Enhancement},
author = {Xinyu Xie and Weifeng Cao and Jun Shi and Yangyang Hu and Hui Liang and Wanyong Liang and Xiaoliang Qian},
journal= {arXiv preprint arXiv:2507.06738},
year = {2025}
}