AudioCLIP:将 CLIP 扩展至图像、文本与音频
声音
2022-09-12 v1 计算机视觉与模式识别
音频与语音处理
摘要
过去,快速发展的声音分类领域极大受益于其他领域方法的应用。如今,我们观察到将领域特定任务与方法相互融合的趋势,这为学界提供了出色的新模型。在本工作中,我们提出了一种 CLIP 模型的扩展,其在处理文本和图像之外还能处理音频。我们提出的模型利用 AudioSet 数据集将 ESResNeXt 音频模型整合进 CLIP 框架。这种组合使所提模型能够执行双模态和单模态分类与查询,同时保持 CLIP 以零样本推理方式泛化到未知数据集的能力。AudioCLIP 在环境声音分类(ESC)任务上取得了新的 SOTA 结果,在 UrbanSound8K 和 ESC-50 数据集上分别达到 90.07% 和 97.15% 的准确率,优于其他方法。此外,它在相同数据集上的零样本 ESC 任务中设定了新的基线(分别为 68.78% 和 69.40%)。最后,我们还评估了所提模型的跨模态查询性能以及完整与部分训练对结果的影响。为了可复现性,我们公开了代码。
引用
@article{arxiv.2106.13043,
title = {AudioCLIP: Extending CLIP to Image, Text and Audio},
author = {Andrey Guzhov and Federico Raue and Jörn Hees and Andreas Dengel},
journal= {arXiv preprint arXiv:2106.13043},
year = {2022}
}
备注
submitted to GCPR 2021