TristouNet:用于说话人轮次嵌入的三元组损失
声音
2017-04-12 v3 机器学习
摘要
TristouNet 是一种基于长短期记忆(LSTM)递归网络的神经网络架构,旨在将语音序列投影到固定维度的欧几里得空间中。得益于训练中使用的三元组损失范式,所得的序列嵌入可以直接使用欧几里得距离进行比较,以用于说话人比对。在短语音(500ms 至 5s 之间)的轮次比较和说话人切换检测实验中表明,TristouNet 在两项任务上均较当前 SOTA 技术带来了显著提升。
引用
@article{arxiv.1609.04301,
title = {TristouNet: Triplet Loss for Speaker Turn Embedding},
author = {Hervé Bredin},
journal= {arXiv preprint arXiv:1609.04301},
year = {2017}
}
备注
ICASSP 2017 (42nd IEEE International Conference on Acoustics, Speech and Signal Processing). Code available at http://github.com/hbredin/TristouNet