中文

说话人识别系统的版本控制

音频与语音处理 2024-06-17 v8 分布式、并行与集群计算 网络与互联网体系结构 软件工程

摘要

本文讨论了说话人识别系统中最具挑战性的实际工程问题之一——模型与用户配置的版本控制。典型的说话人识别系统包含两个阶段:注册阶段,从用户提供的注册音频生成配置;以及运行阶段,将运行时音频的语音身份与存储的配置进行比对。随着技术进步,说话人识别系统需要更新以获得更好性能。然而,若存储的用户配置未相应更新,版本不匹配将导致无意义的识别结果。本文描述了谷歌通过多年工程实践精心研究的说话人识别系统不同版本控制策略。这些策略根据在生产环境中的部署方式分为三类:设备端部署、服务器端部署和混合部署。为在各种网络配置下以量化指标比较不同策略,我们提出 SpeakerVerSim,一个基于 Python、易于扩展的说话人识别系统服务器端部署策略仿真框架。

关键词

引用

@article{arxiv.2007.12069,
  title  = {Version Control of Speaker Recognition Systems},
  author = {Quan Wang and Ignacio Lopez Moreno},
  journal= {arXiv preprint arXiv:2007.12069},
  year   = {2024}
}