中文

用于鲁棒音频指纹的音频去噪

声音 2022-12-23 v1 信息检索 机器学习

摘要

音乐发现服务允许用户通过简短的移动录音识别歌曲。这些解决方案通常基于音频指纹技术,并更具体地依赖于频谱峰值的提取,以对多种失真保持鲁棒性。很少有工作研究这些算法对真实环境中捕获的背景噪声的鲁棒性。特别是,当信噪比较低即背景噪声较强时,AFP 系统仍然存在困难。在本项目中,我们利用深度学习来解决这一问题。我们测试了一种新的混合策略,即在基于峰值的 AFP 算法前端插入一个深度学习去噪模型。我们使用真实的数据增强流水线模拟含噪音乐录音,并训练一个深度学习模型对其进行去噪。该去噪模型限制了背景噪声对 AFP 系统提取峰值的影响,提高了其对噪声的鲁棒性。我们进一步提出了一种新的损失函数,以使该深度学习模型适应所考虑的 AFP 系统,提高了其检索频谱峰值的精度。据我们所知,这种混合策略此前尚未被测试过。

关键词

引用

@article{arxiv.2212.11277,
  title  = {Audio Denoising for Robust Audio Fingerprinting},
  author = {Kamil Akesbi},
  journal= {arXiv preprint arXiv:2212.11277},
  year   = {2022}
}

备注

63 pages, master thesis