中文

H-QuEST:加速基于层次索引的查询示例 spoken term 检索

音频与语音处理 2025-06-23 v1

摘要

查询示例 spoken term 检索(QbE-STD)通过样本 spoken query 在音频数据集中搜索匹配单词或短语。当标注数据有限或不可用时,QbE-STD 常采用动态时间规整(DTW)等模板匹配方法,计算代价高昂且难以扩展。为此,我们提出了 H-QuEST(Hierarchical Query-by-Example Spoken Term Detection),一种新型框架,通过利用通过先进音频表示学习技术获得的基于术语频率(TF)和逆文档频率(IDF)的稀疏表示,结合层次可导航小世界(HNSW)索引进行进一步优化,从而加速 spoken term 检索。实验结果表明,H-QuEST 在不牺牲准确性的前提下,相较于现有方法显著提升了检索速度。

关键词

引用

@article{arxiv.2506.16751,
  title  = {H-QuEST: Accelerating Query-by-Example Spoken Term Detection with Hierarchical Indexing},
  author = {Akanksha Singh and Yi-Ping Phoebe Chen and Vipul Arora},
  journal= {arXiv preprint arXiv:2506.16751},
  year   = {2025}
}