面向交通视频预测的基于时空分块注意力引导的 LSTM
计算机视觉与模式识别
2025-10-09 v4 机器学习
图像与视频处理
摘要
本扩展摘要描述了我们针对 Traffic4Cast Challenge 2019 的解决方案。该任务要求建模细粒度(像素级)与粗粒度(区域级)空间结构,同时保留长序列间的时间关系。基于 Conv-LSTM 思想,我们引入了具有分块感知、级联记忆的 Conv-LSTM,并辅以跨帧加性注意力与灵活记忆训练方案:按空间分块采样帧,使模型学习分块局部动态,且各分块记忆单元可稀疏更新、分页或压缩以扩展至大尺度地图。我们提供了紧凑的理论分析(紧致 softmax/注意力 Lipschitz 界与分块误差下界)来解释稳定性与记忆-精度权衡,并在大规模交通热力图上经验性地展示了改进的扩展性与具竞争力的预测性能。
引用
@article{arxiv.1910.11030,
title = {Spatiotemporal Tile-based Attention-guided LSTMs for Traffic Video Prediction},
author = {Tu Nguyen},
journal= {arXiv preprint arXiv:1910.11030},
year = {2025}
}
备注
Neurips 2019 Traffic4Cast Challenge, v4: added formal proofs