用于文本无关说话人验证的空间金字塔编码与凸长度归一化
音频与语音处理
2019-12-30 v1 计算与语言
机器学习
声音
机器学习
摘要
本文提出一种新的池化方法,称为空间金字塔编码(SPE),用于生成文本无关说话人验证的说话人嵌入。我们首先将深度残差网络(ResNet)输出的特征图划分为逐渐精细的子区域,并通过可学习的字典编码层从每个子区域提取说话人嵌入。这些嵌入被拼接以获得最终的说话人表示。SPE层不仅为变长语音段生成固定维度的说话人嵌入,还聚合了多级时间箱的特征分布信息。此外,我们通过将环损失(ring loss)引入损失函数来实现深度长度归一化。通过应用环损失,网络在保持凸性的同时逐渐学会利用模型权重自身对说话人嵌入进行归一化,从而得到更鲁棒的说话人嵌入。在VoxCeleb1数据集上的实验表明,所提出的采用SPE层和基于环损失的深度长度归一化的系统优于i-vector与d-vector基线。
引用
@article{arxiv.1906.08333,
title = {Spatial Pyramid Encoding with Convex Length Normalization for Text-Independent Speaker Verification},
author = {Youngmoon Jung and Younggwan Kim and Hyungjun Lim and Yeunju Choi and Hoirin Kim},
journal= {arXiv preprint arXiv:1906.08333},
year = {2019}
}
备注
5 pages, 2 figures, Interspeech 2019