中文

基于全息约简表示的音频指纹识别

音频与语音处理 2024-06-21 v1 声音

摘要

本文提出了一种基于全息约简表示(HRR)的音频指纹识别模型。所提出的方法减少了存储的指纹数量,而传统的神经音频指纹识别需要为每个音频轨道存储大量指纹才能实现高精度和时间分辨率。我们利用HRR通过循环卷积和求和将多个指纹聚合为一个复合指纹,从而在保持与原始指纹相同维度的空间内,使用更少的指纹。我们的搜索方法能高效地找到存在查询指纹的复合指纹。利用HRR的逆运算,它可以恢复复合指纹内的相对位置,从而保留原始的时间分辨率。实验表明,我们的方法能够在保持时间分辨率的同时,以适度的精度下降减少指纹数量,性能优于简单的抽取和基于求和的聚合方法。

关键词

引用

@article{arxiv.2406.13139,
  title  = {Audio Fingerprinting with Holographic Reduced Representations},
  author = {Yusuke Fujita and Tatsuya Komatsu},
  journal= {arXiv preprint arXiv:2406.13139},
  year   = {2024}
}

备注

accepted at Interspeech 2024