中文

TristouNet:用于说话人轮次嵌入的三元组损失

声音 2017-04-12 v3 机器学习

摘要

TristouNet 是一种基于长短期记忆(LSTM)递归网络的神经网络架构,旨在将语音序列投影到固定维度的欧几里得空间中。得益于训练中使用的三元组损失范式,所得的序列嵌入可以直接使用欧几里得距离进行比较,以用于说话人比对。在短语音(500ms 至 5s 之间)的轮次比较和说话人切换检测实验中表明,TristouNet 在两项任务上均较当前 SOTA 技术带来了显著提升。

关键词

引用

@article{arxiv.1609.04301,
  title  = {TristouNet: Triplet Loss for Speaker Turn Embedding},
  author = {Hervé Bredin},
  journal= {arXiv preprint arXiv:1609.04301},
  year   = {2017}
}

备注

ICASSP 2017 (42nd IEEE International Conference on Acoustics, Speech and Signal Processing). Code available at http://github.com/hbredin/TristouNet