中文

音频指纹技术在实时可扩展语音检索与语音聚类中的应用

信息检索 2025-09-26 v2 声音 音频与语音处理

摘要

音频指纹技术近年来取得了巨大进步,即使在查询音频样本高度劣化或在嘈杂环境中录制的情况下,也能实现准确快速的音频检索。可以预期,现有的大部分工作都集中在音乐上,例如 Apple 的 Shazam 或 Google 的 Now Playing 等流行音乐识别服务,它们专为移动设备上的个体音频识别而设计。然而,语音的频谱内容与音乐不同,因此需要对当前的音频指纹方法进行修改。本文为调整现有技术以应对电信和云通信平台中语音检索的特殊挑战提供了新的见解。重点是在批处理中实现快速准确的音频检索,而不是促进通常在集中式服务器上进行的单个请求。此外,本文还展示了如何利用这种方法来支持基于语音转录的音频聚类,而无需进行实际的语音到文本转换。这种优化使得处理速度显著加快,且无需 GPU 计算,而 GPU 计算通常是与最先进的语音转文本工具相关的实时操作要求。

关键词

引用

@article{arxiv.2410.21876,
  title  = {Application of Audio Fingerprinting Techniques for Real-Time Scalable Speech Retrieval and Speech Clusterization},
  author = {Kemal Altwlkany and Sead Delalić and Adis Alihodžić and Elmedin Selmanović and Damir Hasić},
  journal= {arXiv preprint arXiv:2410.21876},
  year   = {2025}
}

备注

Proceedings of the International Convention MIPRO