基于对比学习的面向高特异性音频检索的神经音频指纹
声音
2021-02-11 v4 信息检索
机器学习
音频与语音处理
摘要
现有多数音频指纹系统难以用于大规模高特异性音频检索。本工作中,我们从短单元音频段生成低维表示,并将该指纹与快速最大内积搜索相结合。为此,我们提出一种源自段级检索目标的对比学习框架。训练中的每次更新使用一个由一组伪标签、随机选取的原始样本及其增强副本组成的批次。这些副本可通过施加微小时间偏移及各类失真(如背景噪声和房间/麦克风脉冲响应)来模拟原始音频信号上的退化效应。在常规音频指纹系统以往失效的段级检索任务中,我们的系统以 10 倍更小的存储量展现了 promising 的结果。我们的代码与数据集见 \url{https://mimbres.github.io/neural-audio-fp/}。
引用
@article{arxiv.2010.11910,
title = {Neural Audio Fingerprint for High-specific Audio Retrieval based on Contrastive Learning},
author = {Sungkyun Chang and Donmoon Lee and Jeongsoo Park and Hyungui Lim and Kyogu Lee and Karam Ko and Yoonchang Han},
journal= {arXiv preprint arXiv:2010.11910},
year = {2021}
}
备注
ICASSP 2021 (accepted)