探索无监督自回归模型作为文本相关说话人确认共享编码器的应用
音频与语音处理
2020-08-11 v1 机器学习
摘要
本文提出一种利用共享编码器与任务特定解码器处理文本相关自动说话人确认(TD-ASV)的新方法。一个自回归预测编码(APC)编码器以无监督方式使用域外(LibriSpeech、VoxCeleb)与域内(DeepMine)无标签数据集进行预训练,以学习封装说话人与音素内容的一般高层特征表示。两个任务特定解码器使用有标签数据集训练,用于分类说话人(SID)与短语(PID)。从 SID 解码器提取的说话人嵌入经 PLDA 打分。SID 与 PID 系统在分数层融合。在跨语言 DeepMine 数据集上,我们的系统 minDCF 相对全监督 x-vector 基线提升 51.9%。然而,i-vector/HMM 方法优于所提 APC 编码器-解码器系统。在 PID 融合前将 x-vector/PLDA 基线与 SID/PLDA 分数融合,性能进一步提升 15%,表明所提方法与 x-vector 系统具有互补性。我们展示了所提方法可利用大型、无标签、数据丰富的域,并学习与下游任务无关的语音模式。此类系统能在测试数据来自数据稀缺域的域失配场景下提供有竞争力的性能。
引用
@article{arxiv.2008.03615,
title = {Exploring the Use of an Unsupervised Autoregressive Model as a Shared Encoder for Text-Dependent Speaker Verification},
author = {Vijay Ravi and Ruchao Fan and Amber Afshan and Huanhua Lu and Abeer Alwan},
journal= {arXiv preprint arXiv:2008.03615},
year = {2020}
}
备注
Accepted to Interspeech 2020