中文

家用说话人识别的基线系统与协议

音频与语音处理 2022-05-06 v2 声音

摘要

家用设备(如智能音箱)上的说话人识别面临若干挑战:(i)跨大量异构域(家庭)的鲁棒性,(ii)短语音片段,(iii)注册数据可能缺失说话人标签(被动注册),以及(iv)未知人员(访客)的存在。尽管存在许多商业产品,但已发表的研究较少,且没有公开可用的评估协议或开源基线系统。我们的工作旨在通过提供基于公共资源(VoxCeleb 和 ASVspoof 2019 数据)构建的易用评估基准以及一组初步的开源基线系统来弥合这一差距。这包括四种用于主动注册(可用说话人标签)的算法和一种用于被动注册的算法。

关键词

引用

@article{arxiv.2205.00288,
  title  = {Baselines and Protocols for Household Speaker Recognition},
  author = {Alexey Sholokhov and Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
  journal= {arXiv preprint arXiv:2205.00288},
  year   = {2022}
}

备注

Accepted to Odyssey 2022