应对背景噪声和失真挑战以提升音频指纹识别精度
声音
2024-06-04 v2 机器学习
音频与语音处理
摘要
以 Shazam 等先驱为代表的音频指纹识别技术彻底改变了数字音频识别。然而,现有系统在具有挑战性的条件下难以保证精度,限制了其广泛应用。本研究提出了一种集成 AI 和 ML 的音频指纹识别算法以提高精度。该研究建立在 Dejavu Project 的基础之上,强调在多样化背景噪声和失真下的真实场景模拟。作为 Dejavu 模型核心的信号处理包括快速傅里叶变换(Fast Fourier Transform)、频谱图和峰值提取。“星座”概念和指纹哈希实现了独特的歌曲识别。性能评估证实,在 5 秒音频输入内准确率可达 100%,且系统展现出可预测的匹配速度以确保效率。存储分析突出了实际实施中关键的空间 - 速度权衡。本研究推进了音频指纹识别的适应性,解决了不同环境和应用中的挑战。
引用
@article{arxiv.2402.13957,
title = {Advancing Audio Fingerprinting Accuracy Addressing Background Noise and Distortion Challenges},
author = {Navin Kamuni and Sathishkumar Chintala and Naveen Kunchakuri and Jyothi Swaroop Arlagadda Narasimharaju and Venkat Kumar},
journal= {arXiv preprint arXiv:2402.13957},
year = {2024}
}