家用说话人识别的基线系统与协议
音频与语音处理
2022-05-06 v2 声音
摘要
家用设备(如智能音箱)上的说话人识别面临若干挑战:(i)跨大量异构域(家庭)的鲁棒性,(ii)短语音片段,(iii)注册数据可能缺失说话人标签(被动注册),以及(iv)未知人员(访客)的存在。尽管存在许多商业产品,但已发表的研究较少,且没有公开可用的评估协议或开源基线系统。我们的工作旨在通过提供基于公共资源(VoxCeleb 和 ASVspoof 2019 数据)构建的易用评估基准以及一组初步的开源基线系统来弥合这一差距。这包括四种用于主动注册(可用说话人标签)的算法和一种用于被动注册的算法。
引用
@article{arxiv.2205.00288,
title = {Baselines and Protocols for Household Speaker Recognition},
author = {Alexey Sholokhov and Xuechen Liu and Md Sahidullah and Tomi Kinnunen},
journal= {arXiv preprint arXiv:2205.00288},
year = {2022}
}
备注
Accepted to Odyssey 2022