中文

通过建模通道间相关性提取说话人嵌入

音频与语音处理 2021-07-08 v2 计算机视觉与模式识别

摘要

利用深度二维卷积神经网络提取的说话人嵌入通常建模为沿时间轴使用平均或注意力池化,将通道-频率对的一阶和二阶统计量投影到线性层上。本文研究了一种替代池化方法,该方法使用给定频率下通道之间的两两相关性作为统计量。该方法受计算机视觉中风格迁移方法的启发,其中图像的风格由通道间相关性矩阵建模,并被迁移到另一幅图像上,以生成具有第一幅图像风格和第二幅图像内容的新图像。通过将图像风格与说话人特征、图像内容与音素序列进行类比,我们探索使用此类通道间相关性特征以端到端方式训练 ResNet 架构。我们在 VoxCeleb 上的实验证明了所提池化方法在说话人识别中的有效性。

关键词

引用

@article{arxiv.2104.02571,
  title  = {Speaker embeddings by modeling channel-wise correlations},
  author = {Themos Stafylakis and Johan Rohdin and Lukas Burget},
  journal= {arXiv preprint arXiv:2104.02571},
  year   = {2021}
}

备注

Accepted at Interspeech 2021