通过对比学习和音频预训练提升 vocal imitation 查询性能
音频与语音处理
2024-08-22 v1
摘要
以人类声音创作的 vocal imitation 进行查询搜索数据库中的音频文件的技术称为 vocal imitation 查询(QBV)。由于大多数人类能够通过语音有效地传达声音概念,QBV 相较于基于文本的搜索更具直观性和便利性。为了充分发挥 QBV 的潜力,对于 vocal imitation 和原始声音的音频特征表示至关重要。本文提出了一种新的 QBV 系统,利用基于大规模通用音频数据集预训练的卷积神经网络的特征提取能力。我们将这些预训练模型集成到双编码器架构中,并使用对比学习进行端到端微调。我们方法的独特之处在于,使用适用于对比学习的改进 NT-Xent 损失函数进行预训练模型的微调,在 reference recording 和 vocal imitation 之间创建共享嵌入空间。该提议系统显著提升了音频检索性能,在粗粒度和细粒度 QBV 任务上均建立了新的最佳性能。
引用
@article{arxiv.2408.11638,
title = {Improving Query-by-Vocal Imitation with Contrastive Learning and Audio Pretraining},
author = {Jonathan Greif and Florian Schmid and Paul Primus and Gerhard Widmer},
journal= {arXiv preprint arXiv:2408.11638},
year = {2024}
}
备注
Accepted to the DCASE Workshop 2024. Source code available: https://github.com/Jonathan-Greif/QBV