中文

说话人验证的新视角:DFSMN 与 Transformer 的联合建模

音频与语音处理 2024-09-10 v4 声音

摘要

说话人验证是在开放集合中判断两个未知语音之间的相似度,其中理想的说话人嵌入应能将判别信息凝练为紧凑的话语级表示,该表示具有较小的说话人内部距离和较大的说话人间距离。我们提出了 Voice Transformer (VOT),一种用于说话人验证的新模型,它集成了多尺度的并行 Transformer。将深度前馈序列记忆网络(DFSMN)结合到这些 Transformer 的注意力部分,以增加特征粒度。添加注意力统计池化层以关注重要帧并形成话语级特征。我们提出加性角度间隔焦点损失(AAMF)来解决困难样本问题。我们在 VoxCeleb1 和 CN-Celeb2 数据集上评估了所提出的方法,表明 VOT 超越了大多数主流模型。代码可在 GitHub 上获取\footnote{\url{https://github.com/luckyerr/Voice-Transformer_Speaker-Verification}}。

关键词

引用

@article{arxiv.2312.16826,
  title  = {A New Perspective on Speaker Verification: Joint Modeling with DFSMN and Transformer},
  author = {Hongyu Wang and Hui Li and Bo Li},
  journal= {arXiv preprint arXiv:2312.16826},
  year   = {2024}
}

备注

5 pages,4 figures,3 tables