融合音素信息的说话人嵌入提取
声音
2018-06-15 v2 音频与语音处理
摘要
说话人嵌入在许多说话人验证任务上取得了令人满意的结果。音素信息作为语音的重要组成部分,在说话人嵌入提取中很少被考虑。本文基于 x-vector 架构,将音素信息引入说话人嵌入提取。提出了两种分别利用音素向量和多任务学习的方法。在 Fisher 数据集上,我们的最佳系统相较原始 x-vector 方法在 EER 上提升 20%,在 minDCF08 和 minDCF10 上分别提升 15%、15%。在 NIST SRE10 上进行的实验进一步证明了所提方法的有效性。
引用
@article{arxiv.1804.04862,
title = {Speaker Embedding Extraction with Phonetic Information},
author = {Yi Liu and Liang He and Jia Liu and Michael T. Johnson},
journal= {arXiv preprint arXiv:1804.04862},
year = {2018}
}
备注
submitted to Interspeech 2018 (accepted) and open-sourced. Please refer to Interspeech for the final version