中文

用于行为分析的多模态视觉Transformer与强制注意力机制

计算机视觉与模式识别 2022-12-09 v1

摘要

人类行为理解需要在包含多种输入模态的场景大背景中观察细微细节。这是必要的,因为它允许设计更像人类的机器。虽然Transformer方法已显示出巨大改进,但它们面临诸多挑战,如数据缺乏或背景噪声。为应对这些,我们引入了强制注意力(FAt)Transformer,其利用强制注意力与修改后的骨干网络进行输入编码,并使用额外输入。除了在不同任务和输入上提升性能外,该修改需要更少的时间和内存资源。我们提供了一种针对社会信号与行为分析任务的通用特征提取模型。我们的重点在于理解视频中的行为,其中人们相互交互或对着摄像头说话,这模拟了社会交互中的第一人称视角。FAt Transformer被应用于两个下游任务:性格识别与肢体语言识别。我们在Udiva v0.5、First Impressions v2和MPII Group Interaction数据集上取得了最先进(SOTA)的结果。我们进一步对所提架构进行了广泛的消融研究。

关键词

引用

@article{arxiv.2212.03968,
  title  = {Multimodal Vision Transformers with Forced Attention for Behavior Analysis},
  author = {Tanay Agrawal and Michal Balazia and Philipp Müller and François Brémond},
  journal= {arXiv preprint arXiv:2212.03968},
  year   = {2022}
}

备注

Preprint. Full paper accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), Waikoloa, USA, Jan 2023. 11 pages