基于X-vector的文本相关说话人验证中的瓶颈特征研究
音频与语音处理
2020-09-02 v2 机器学习
声音
摘要
将x-vector应用于说话人验证近来引起了极大兴趣,其焦点在于文本无关说话人验证。在本文中,我们研究用于文本相关说话人验证(TD-SV)的x-vector,该方向尚待探索。我们进一步考察不同瓶颈(BN)特征对x-vector性能的影响,包括最近引入的时间对比学习(TCL)BN特征和音素判别BN特征。TCL是一种弱监督学习方法,它通过将所有语音均匀划分为预定义数量的段,然后根据段在语音中的位置为每个段分配类别标签来构造训练数据。我们还比较了不同建模技术下的TD-SV性能,包括高斯混合模型-通用背景模型(GMM-UBM)、i-vector和x-vector。实验在RedDots 2016挑战数据库上进行。研究发现,特征类型对x-vector性能影响甚微,其中TCL BN特征取得了最低等错误率,而特征对i-vector和GMM-UBM影响显著。x-vector与i-vector系统的融合带来了大幅性能提升。GMM-UBM技术在使用短语音的TD-SV中展现出其优势。
引用
@article{arxiv.2005.07383,
title = {On Bottleneck Features for Text-Dependent Speaker Verification Using X-vectors},
author = {Achintya Kumar Sarkar and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2005.07383},
year = {2020}
}