用于文本无关说话人识别的帧级说话人嵌入及端到端模型分析
音频与语音处理
2018-09-13 v1 机器学习
摘要
在本文中,我们提出一种基于卷积神经网络(CNN)的说话人识别模型,用于提取鲁棒的说话人嵌入。该嵌入可通过嵌入层中的线性激活高效提取。为了理解说话人识别模型如何处理文本无关输入,我们修改结构以从每个隐藏层提取帧级说话人嵌入。我们将TIMIT数据集中的语音送入训练好的网络,并使用若干代理任务来研究网络表示语音输入和区分说话人身份的能力。我们发现,网络在区分宽泛语音类别方面优于区分单个音素。特别地,对于同一说话人,属于相同语音类别的帧级嵌入(基于余弦距离)是相似的。帧级表示还使我们能够在帧级分析网络,并具有用于其他分析以改进说话人识别的潜力。
引用
@article{arxiv.1809.04437,
title = {Frame-level speaker embeddings for text-independent speaker recognition and analysis of end-to-end model},
author = {Suwon Shon and Hao Tang and James Glass},
journal= {arXiv preprint arXiv:1809.04437},
year = {2018}
}
备注
Accepted at SLT 2018; Supplement materials: https://people.csail.mit.edu/swshon/supplement/slt18.html