深度神经网络中用于说话人确认的时间池化研究
音频与语音处理
2021-05-11 v1 声音
摘要
x-vector 架构最近在说话人确认任务上取得了 SOTA 结果。该架构包含一个称为时间池化的中心层,其堆叠声学帧分布的统计参数。本文旨在揭示时间池化内容对训练动态和任务性能的显著影响。我们使用不同的池化层进行评估,即包含不同的集中趋势统计量。值得注意的是,还测试了基于三阶和四阶矩的统计量(偏度和峰度),以补全常用的均值和标准差参数。我们的实验显示了池化层内容对说话人确认性能的影响,也对若干分类任务(说话人、信道或文本相关)有影响,并依据层内容更好地揭示了说话人身份之外的外部信息的存在。
引用
@article{arxiv.2105.04310,
title = {Study on the temporal pooling used in deep neural networks for speaker verification},
author = {Mickael Rouvier and Pierre-Michel Bousquet and Jarod Duret},
journal= {arXiv preprint arXiv:2105.04310},
year = {2021}
}