中文

MAiVAR-T:基于 Transformer 的多模态音频-图像与视频动作识别器

计算机视觉与模式识别 2023-08-08 v1 人工智能 机器学习 多媒体

摘要

鉴于人类能够通过同时处理并整合来自视觉、音频等多种模态的高维输入来感知世界,我们提出了一种新颖模型 MAiVAR-T(多模态音频-图像到视频动作识别 Transformer,Multimodal Audio-Image to Video Action Recognition Transformer)。该模型采用一种直观的方法来融合音频-图像与视频模态,主要目标是提升多模态人体动作识别(MHAR)的效果。MAiVAR-T 的核心在于从音频模态中提取丰富表征并将其转换到图像域的重要性。随后,该音频-图像表征与视频模态融合以形成统一表征。这一协同方法力求利用音频与视频模态中固有的上下文丰富性,从而促进动作识别。与现有仅关注音频或视频模态的 SOTA 策略相比,MAiVAR-T 展现出更优的性能。我们在基准动作识别数据集上进行的广泛实证评估证实了该模型卓越的性能,这凸显了为动作识别目的而融合音频与视频模态所带来的潜在提升。

关键词

引用

@article{arxiv.2308.03741,
  title  = {MAiVAR-T: Multimodal Audio-image and Video Action Recognizer using Transformers},
  author = {Muhammad Bilal Shaikh and Douglas Chai and Syed Mohammed Shamsul Islam and Naveed Akhtar},
  journal= {arXiv preprint arXiv:2308.03741},
  year   = {2023}
}

备注

6 pages, 7 figures, 4 tables, Peer reviewed, Accepted @ The 11th European Workshop on Visual Information Processing (EUVIP) will be held on 11th-14th September 2023, in Gj{\o}vik, Norway. arXiv admin note: text overlap with arXiv:2103.15691 by other authors