MAiVAR:多模态音频-图像与视频动作识别器
计算机视觉与模式识别
2023-01-20 v1
摘要
目前,动作识别主要由 CNN 处理的视频数据来完成。我们研究 CNN 的表征过程是否也可通过在一任务中引入基于图像的动作音频表征而用于多模态动作识别。为此,我们提出多模态音频-图像与视频动作识别器(MAiVAR),一种基于 CNN 的音频-图像到视频融合模型,该模型综合考虑视频与音频模态以实现更优的动作识别性能。MAiVAR 提取音频的有意义图像表征,并将其与视频表征融合,从而在大规模动作识别数据集上相比任一单独模态均取得更好性能。
引用
@article{arxiv.2209.04780,
title = {MAiVAR: Multimodal Audio-Image and Video Action Recognizer},
author = {Muhammad Bilal Shaikh and Douglas Chai and Syed Mohammed Shamsul Islam and Naveed Akhtar},
journal= {arXiv preprint arXiv:2209.04780},
year = {2023}
}
备注
Peer reviewed & accepted at IEEE VCIP 2022 (http://www.vcip2022.org/)