基于CNN的多输入多输出模型用于高效时空预测
计算机视觉与模式识别
2026-05-05 v1 人工智能
摘要
最近提出了基于卷积神经网络(CNN)或Transformer架构的模型,以克服循环神经网络(RNN)基于模型在时空预测中的局限性。这些模型防止了由于序列特性导致的并行效率限制以及由于递归方法导致的堆叠误差,并展现出高性能。然而,仍存在一些挑战。首先,CNN基于模型由于卷积核的局部特性,难以考虑全局信息,其性能受限。此外,由于将时间轴与图像的通道轴组合进行处理,信息被混合。基于Transformer架构的模型由于自注意力计算而具有高复杂度,并需要较长的训练时间。本文提出一种新结构模型,称为CNN-based Multi-In-Multi-Out model for Efficient Spatiotemporal Prediction (MIMO-ESP),以克服这些局限性。MIMO-ESP考虑全局信息,通过配置基于CNN的Transformer架构显著降低复杂度。此外,它将时间轴作为独立轴而不进行组合,通过应用膨胀有效地共同考虑时空信息。这种结构使MIMO-ESP具有高效性和高性能。对三个有前景的基准数据集进行的广泛实验结果,包括视频、交通和降雨预测任务,证明了MIMO-ESP由于实现了竞争性的效率而优于现有模型。此外,消融研究结果证明了MIMO-ESP组件的有用性,强调了所提出方法的潜力。
引用
@article{arxiv.2605.01277,
title = {CNN-based Multi-In-Multi-Out Model for Efficient Spatiotemporal Prediction},
author = {Hyeonseok Jin},
journal= {arXiv preprint arXiv:2605.01277},
year = {2026}
}
备注
Master's thesis