Attend-Fusion: 面向视频分类的高效音视频融合方法
计算机视觉与模式识别
2024-08-27 v1 人工智能
摘要
利用音频和视觉模态进行视频分类是一项具有挑战性的任务,因为现有方法需要大型模型架构,导致计算复杂度和资源需求很高。另一方面,较小的架构难以达到最优性能。在本文中,我们提出了 Attend-Fusion,一种音视频(AV)融合方法,它引入了一种紧凑的模型架构,专门设计用于捕捉视频数据中复杂的音视频关系。通过在具有挑战性的 YouTube-8M 数据集上进行大量实验,我们证明 Attend-Fusion 仅用 72M 参数就达到了 75.64% 的 F1 分数,这与更大的基线模型(如全连接后期融合,F1 分数 75.96%,341M 参数)的性能相当。Attend-Fusion 在实现与更大基线模型相似性能的同时,将模型大小减少了近 80%,突显了其在模型复杂度方面的效率。我们的工作表明,Attend-Fusion 模型有效地结合了音频和视觉信息进行视频分类,在显著减小模型尺寸的同时实现了有竞争力的性能。这种方法为在各种应用的资源受限环境中部署高性能视频理解系统开辟了新的可能性。
引用
@article{arxiv.2408.14441,
title = {Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification},
author = {Mahrukh Awan and Asmar Nadeem and Muhammad Junaid Awan and Armin Mustafa and Syed Sameed Husain},
journal= {arXiv preprint arXiv:2408.14441},
year = {2024}
}