中文

克服基于Transformer的下一帧预测中的语义稀释问题

计算机视觉与模式识别 2025-01-29 v1 人工智能

摘要

视频中的下一帧预测对于自动驾驶、目标跟踪和运动预测等应用至关重要。下一帧预测的主要挑战在于有效地捕获和处理前一视频序列的空间和时间信息。基于Transformer架构的模型因其在处理序列数据方面的卓越能力,在这一领域取得了显著进展。然而,基于Transformer的下一帧预测模型面临两个显著问题:(a) 多头自注意力(MHSA)机制需要将输入嵌入分割为N个块,其中N为头的数量。每个片段仅捕获原始嵌入信息的一部分,这会导致潜在空间中表示失真,引发语义稀释问题;(b) 这些模型预测下一帧的嵌入而非帧本身,但基于重建帧误差的损失函数并非针对预测嵌入,这会在训练目标与模型输出之间产生差距。我们提出了语义集中多头自注意力(SCMHSA)架构,有效缓解了基于Transformer的下一帧预测中的语义稀释问题。此外,我们引入一种损失函数,在潜在空间中优化SCMHSA,使训练目标更贴近模型输出。我们的方法在与原始基于Transformer的预测器之间展现出优异的性能。

关键词

引用

@article{arxiv.2501.16753,
  title  = {Overcoming Semantic Dilution in Transformer-Based Next Frame Prediction},
  author = {Hy Nguyen and Srikanth Thudumu and Hung Du and Rajesh Vasa and Kon Mouzakis},
  journal= {arXiv preprint arXiv:2501.16753},
  year   = {2025}
}