使用预训练大型多模态模型的音频-视觉广义零样本学习
计算机视觉与模式识别
2024-04-10 v1
摘要
音频-视觉零样本学习方法通常依赖于从预训练模型(例如视频或音频分类模型)中提取的特征。然而,现有的基准测试早于大型多模态模型(如CLIP和CLAP)的普及。在这项工作中,我们探索使用这些大型预训练模型来获取特征,即CLIP用于视觉特征,CLAP用于音频特征。此外,CLIP和CLAP的文本编码器提供了类别标签嵌入,这些嵌入被组合以提升系统性能。我们提出了一个简单而有效的模型,仅依赖前馈神经网络,利用了新的音频、视觉和文本特征的强大泛化能力。我们的框架在VGGSound-GZSL、UCF-GZSL和ActivityNet-GZSL上使用新特征达到了最先进的性能。代码和数据可在https://github.com/dkurzend/ClipClap-GZSL获取。
引用
@article{arxiv.2404.06309,
title = {Audio-Visual Generalized Zero-Shot Learning using Pre-Trained Large Multi-Modal Models},
author = {David Kurzendörfer and Otniel-Bogdan Mercea and A. Sophia Koepke and Zeynep Akata},
journal= {arXiv preprint arXiv:2404.06309},
year = {2024}
}
备注
CVPRw 2024 (L3D-IVU)