中文

TKN:基于 Transformer 的实时视频预测关键点网络

计算机视觉与模式识别 2026-02-17 v3 人工智能

摘要

视频预测是一项复杂的时间序列预测任务,在许多应用场景中具有巨大潜力。然而,传统方法因模型结构复杂、信息冗余及 GPU 内存消耗过大而侧重精度,忽视了缓慢的预测速度。这些方法常顺序预测帧,难以加速,限制了其在危险预测与预警等实时场景中的适用性。为此,我们提出一种基于 Transformer 的关键点预测神经网络(TKN)。TKN 以无监督方式从视频帧中提取动态内容,减少冗余特征计算;并使用加速矩阵降低注意力的计算成本,采用并行计算结构实现预测加速。据我们所知,TKN 是首个达到 1,176 fps 预测速率的实时视频预测方案,在保持其他性能的同时显著降低了计算成本。在多个数据集上的定性与定量实验均证明了我们方法的优越性,表明 TKN 具有很大的应用潜力。

关键词

引用

@article{arxiv.2303.09807,
  title  = {TKN: Transformer-based Keypoint Prediction Network For Real-time Video Prediction},
  author = {Haoran Li and XiaoLu Li and Yihang Lin and Yanbin Hao and Haiyong Xie and Pengyuan Zhou and Yong Liao},
  journal= {arXiv preprint arXiv:2303.09807},
  year   = {2026}
}