中文

带注意力设计的视觉增强预测自编码器(VAPAAD)

计算机视觉与模式识别 2024-04-18 v2 人工智能

摘要

序列预测的最新进展显著提高了视频数据解释的准确性;然而,现有模型往往忽视了基于注意力机制在下一帧预测中的潜力。本研究引入了带注意力设计的视觉增强预测自编码器(VAPAAD),这是一种将注意力机制集成到序列预测中的创新方法,能够对视频序列中的时间动态进行细致的分析与理解。利用 Moving MNIST 数据集,我们展示了 VAPAAD 相比传统方法具有稳健的性能和更出色的复杂数据处理能力。VAPAAD 结合了数据增强、ConvLSTM2D 层和定制的自注意力机制,以有效聚焦于序列中的显著特征,从而提高预测准确性和上下文感知分析能力。该方法不仅符合人类在视频解释过程中的认知过程,而且解决了传统模型中的局限性,这些传统模型通常难以应对视频序列中固有的变异性。实验结果证实,VAPAAD 优于现有模型,尤其是在集成注意力机制方面,这显著提升了预测性能。

关键词

引用

@article{arxiv.2404.10096,
  title  = {Vision Augmentation Prediction Autoencoder with Attention Design (VAPAAD)},
  author = {Yiqiao Yin},
  journal= {arXiv preprint arXiv:2404.10096},
  year   = {2024}
}

备注

12 pages, 4 figures