中文

面向多注册语音的自动说话人确认注意力后端

音频与语音处理 2022-10-25 v2 声音

摘要

概率线性判别分析(PLDA)或余弦相似度作为衡量成对相似度的后端技术,已广泛用于传统说话人确认系统。为更好利用多注册语音,我们提出一种新颖的注意力后端模型,可用于文本无关(TI)与文本相关(TD)说话人确认,并采用缩放点积自注意力与前馈自注意力网络作为学习注册语音内部关系的架构。为验证所提注意力后端,我们在 CNCeleb 与 VoxCeleb 数据集上结合若干最先进说话人编码器(包括 TDNN 与 ResNet)进行了一系列实验。在 CNCeleb 上使用多注册语音的实验结果表明,对于每个说话人编码器,所提注意力后端模型比 PLDA 与余弦相似度对应方法取得更低的 EER 与 minDCF 分数;在 VoxCeleb 上的实验表明我们的模型甚至可用于单注册情形。

关键词

引用

@article{arxiv.2104.01541,
  title  = {Attention Back-end for Automatic Speaker Verification with Multiple Enrollment Utterances},
  author = {Chang Zeng and Xin Wang and Erica Cooper and Xiaoxiao Miao and Junichi Yamagishi},
  journal= {arXiv preprint arXiv:2104.01541},
  year   = {2022}
}