中文

VoxWatch:基于 VoxCeleb 的开放集说话人识别基准

音频与语音处理 2023-07-04 v1 人工智能 机器学习

摘要

尽管开放集说话人识别(OSI)在欺诈预防等方面具有广泛的实际应用,但相较于说话人验证(SV),其在说话人识别领域受到的关注较少。OSI 旨在判断一段测试语音样本是来自一组预先注册个体(集合内)中的某说话人,还是来自集合外说话人。除语音变异性带来的典型挑战外,OSI 还容易出现“误警问题”;随着集合内说话人数量(即监视名单)的增长,集合外得分变大,导致误警率上升。这对于金融机构和边境安全等监视名单规模通常达数千说话人的应用尤为棘手。因此,系统性地量化误警问题并开发缓解监视名单规模对检测性能影响的技术十分重要。此前关于该问题的研究稀少,且缺乏用于系统评估的通用基准。本文提出首个基于 VoxCeleb 数据集构建的 OSI 公开基准。我们利用三个鲁棒的神经网络系统,量化了监视名单规模与语音时长对基于监视名单的说话人检测任务的影响。与已有研究结论相反,我们发现常用的自适应分数归一化并不能保证改善该任务性能。另一方面,我们表明分数校准与分数融合——SV 中另两种常用技术——可显著提升 OSI 性能。

关键词

引用

@article{arxiv.2307.00169,
  title  = {VoxWatch: An open-set speaker recognition benchmark on VoxCeleb},
  author = {Raghuveer Peri and Seyed Omid Sadjadi and Daniel Garcia-Romero},
  journal= {arXiv preprint arXiv:2307.00169},
  year   = {2023}
}

备注

8 pages