MACCIF-TDNN:基于TDNN的说话人验证中通道与上下文相互依赖特征的多方面聚合
声音
2021-07-08 v1 计算与语言
音频与语音处理
摘要
近来说话人验证的大部分最先进(state-of-the-art)结果由X-vector及其后续变体取得。本文中,我们提出一种新的网络架构,基于时延神经网络(Time Delay Neural Network, TDNN)从多方面聚合通道与上下文相互依赖特征。首先,我们使用ECAPA-TDNN中的SE-Res2Blocks来显式建模通道相互依赖以实现通道特征的自适应校准,并以比传统基于TDNN的方法更细的粒度以多尺度方式处理局部上下文特征。其次,我们探索使用Transformer的编码器结构在语句级别建模全局上下文相互依赖特征,以更好地捕获长期时序特性。在池化层之前,我们聚合SE-Res2Blocks与Transformer编码器的输出,以利用它们各自学习到的互补的通道与上下文相互依赖特征。最后,不同于执行单一注意力统计池化,我们也发现以多头方式扩展池化方法是有益的,可从多方面判别特征。所提出的MACCIF-TDNN架构在VoxCeleb1测试集上优于大多数最先进的基于TDNN的系统。
引用
@article{arxiv.2107.03104,
title = {MACCIF-TDNN: Multi aspect aggregation of channel and context interdependence features in TDNN-based speaker verification},
author = {Fangyuan Wang and Zhigang Song and Hongchen Jiang and Bo Xu},
journal= {arXiv preprint arXiv:2107.03104},
year = {2021}
}
备注
6 pages. arXiv admin note: text overlap with arXiv:2005.07143 by other authors