中文

TAMFormer:基于学习注意力掩码的多模态 Transformer 用于早期意图预测

计算机视觉与模式识别 2022-10-27 v1 多媒体

摘要

人类意图预测是一个不断发展的研究领域,其中基于视觉的系统需要预测视频中的活动。为此,模型创建过去的表示,随后产生关于即将发生场景的未来假设。在本工作中,我们关注行人的早期意图预测,其中根据城市场景的当前观察,模型预测接近街道的行人的未来活动。我们的方法基于多模态 Transformer,它编码过去的观察并在不同的预测时间产生多个预测。此外,我们提出学习基于 Transformer 的模型(Temporal Adaptive Mask Transformer)的注意力掩码,以便对不同地权衡当前和过去的时间依赖性。我们在几个用于早期意图预测的公共基准上研究了我们的方法,与先前的工作相比,在不同预测时间上提高了预测性能。

关键词

引用

@article{arxiv.2210.14714,
  title  = {TAMFormer: Multi-Modal Transformer with Learned Attention Mask for Early Intent Prediction},
  author = {Nada Osman and Guglielmo Camporese and Lamberto Ballan},
  journal= {arXiv preprint arXiv:2210.14714},
  year   = {2022}
}