关于文本相关说话人验证中深度表示学习的训练目标与激活函数
声音
2022-01-19 v1 机器学习
音频与语音处理
摘要
深度表示学习在推动文本相关说话人验证(TD-SV)系统发展方面获得了显著动力。在设计用于提取瓶颈特征的深度神经网络(DNN)时,关键考量包括训练目标、激活函数和损失函数。本文系统性地研究这些选择对 TD-SV 性能的影响。对于训练目标,我们考虑说话人身份、时间对比学习(TCL)和自回归预测编码,其中第一个为监督式,后两个为自监督式。此外,当以说话人身份作为训练目标时,我们研究了一系列损失函数。关于激活函数,我们研究了广泛使用的 sigmoid 函数、修正线性单元(ReLU)和高斯误差线性单元(GELU)。我们通过实验表明,无论训练目标如何,与 sigmoid 相比,GELU 均能显著降低 TD-SV 的错误率。在三种训练目标中,TCL 表现最佳。在各种损失函数中,交叉熵、联合 softmax 和 focal loss 函数优于其他函数。最后,不同系统的分数级融合也能降低错误率。实验在 RedDots 2016 挑战数据库上使用短语音进行 TD-SV。对于说话人分类,使用了著名的高斯混合模型-通用背景模型(GMM-UBM)和 i-vector 技术。
引用
@article{arxiv.2201.06426,
title = {On Training Targets and Activation Functions for Deep Representation Learning in Text-Dependent Speaker Verification},
author = {Achintya kr. Sarkar and Zheng-Hua Tan},
journal= {arXiv preprint arXiv:2201.06426},
year = {2022}
}