基于特征图缩放的改进 RawNet 用于原始波形文本无关说话人验证
音频与语音处理
2020-05-08 v2 计算与语言
声音
摘要
深度学习的近期进展促进了直接输入原始波形的说话人验证系统的设计。例如,RawNet 从原始波形中提取说话人嵌入,简化了处理流程并展现出有竞争力的性能。在本研究中,我们通过使用多种方法缩放特征图来改进 RawNet。所提出的机制利用一个采用 sigmoid 非线性函数的缩放向量。它指的是维度等于给定特征图中滤波器数量的向量。利用缩放向量,我们提出对特征图进行乘性缩放、加性缩放或两者兼具。此外,我们探究用 SincNet 的 sinc-卷积层替换第一卷积层。在 VoxCeleb1 评估数据集上进行的实验证明了所提方法的有效性,并且最佳性能系统相比原始 RawNet 将等错误率减半。使用 VoxCeleb1-E 和 VoxCeleb-H 协议获得的扩展评估结果略微优于现有的最先进系统。
引用
@article{arxiv.2004.00526,
title = {Improved RawNet with Feature Map Scaling for Text-independent Speaker Verification using Raw Waveforms},
author = {Jee-weon Jung and Seung-bin Kim and Hye-jin Shim and Ju-ho Kim and Ha-Jin Yu},
journal= {arXiv preprint arXiv:2004.00526},
year = {2020}
}
备注
5 pages, 1 figure, 5 tables, submitted to Interspeech 2020 as a conference paper