基于随机说话人变化子空间的大规模说话人检索
音频与语音处理
2019-06-19 v2 信息检索
摘要
本文描述了一种快速的说话人搜索系统,用于在大规模数据中检索同一语音身份的片段。近期研究表明,局部敏感哈希 (LSH) 结合 i-vector 能够在保持准确率的同时实现大规模数据中相关语音的快速检索。本文中,我们提出随机说话人变化子空间 (RSS) 投影,将数据映射至基于 LSH 的哈希表。我们假设,相较于在不考虑数据的情况下投影到完全随机子空间,投影到随机生成的说话人变化空间会给将同一说话人表示放入相同哈希桶提供更多机会,从而可使用更少的哈希表数量。可通过从大规模说话人队列中随机选取说话人子集来生成多个 RSS。实验结果表明,所提方法分别比线性搜索与 LSH 快 100 倍和 7 倍。
引用
@article{arxiv.1811.10812,
title = {Large-scale Speaker Retrieval on Random Speaker Variability Subspace},
author = {Suwon Shon and Younggun Lee and Taesu Kim},
journal= {arXiv preprint arXiv:1811.10812},
year = {2019}
}
备注
Interspeech 2019