中文

视频分类的高效音视融合

计算机视觉与模式识别 2024-11-11 v1

摘要

我们提出了Attend-Fusion,这是一种新颖且高效的用于视频分类任务中的音视融合的方法。我们的 метод解决了在保持紧凑模型架构的同时同时利用音频和视觉两种模态的挑战。通过在YouTube-8M数据集上进行大量实验,我们证明了Attend-Fusion在显著降低模型复杂度后,能够与更大基线模型实现相当的性能。

关键词

引用

@article{arxiv.2411.05603,
  title  = {Efficient Audio-Visual Fusion for Video Classification},
  author = {Mahrukh Awan and Asmar Nadeem and Armin Mustafa},
  journal= {arXiv preprint arXiv:2411.05603},
  year   = {2024}
}

备注

CVMP Short Paper