基于原始波形与 SincNet 的说话人识别
音频与语音处理
2019-08-12 v3 机器学习
声音
信号处理
摘要
深度学习正逐渐作为一种可行的 i-vector 替代方案在说话人识别中流行起来。最近,当卷积神经网络(CNNs)直接以原始语音样本作为输入时,取得了有前景的结果。与采用标准手工特征不同,这类 CNN 从波形中学习低层语音表示,潜在地使网络能更好地捕捉音高和共振峰等重要窄带说话人特征。神经网络的合理设计对实现该目标至关重要。本文提出一种称为 SincNet 的新型 CNN 架构,其促使第一卷积层发现更有意义的滤波器。SincNet 基于参数化 sinc 函数,其实现带通滤波器。与学习每个滤波器所有元素的标准 CNN 不同,所提方法仅从数据中直接学习低截止和高截止频率。这提供了一种非常紧凑且高效的方式来推导专为所需应用定制的滤波器组。我们在说话人辨认和说话人验证任务上的实验表明,所提架构比原始波形上的标准 CNN 收敛更快且性能更优。
引用
@article{arxiv.1808.00158,
title = {Speaker Recognition from Raw Waveform with SincNet},
author = {Mirco Ravanelli and Yoshua Bengio},
journal= {arXiv preprint arXiv:1808.00158},
year = {2019}
}
备注
In Proceedings of SLT 2018