中文

基于三元组嵌入距离与相似度学习的文本无关说话人确认

音频与语音处理 2019-08-08 v1 计算与语言 机器学习 声音

摘要

说话人嵌入在文本无关说话人确认任务中日益流行。本文提出训练阶段的两项改进。这些改进均基于三元组,因为基线 x-vector 系统的训练阶段与评估阶段关注不同目标。首先,我们引入三元组损失以优化嵌入间的欧氏距离,同时最小化多类交叉熵损失。其次,我们设计了一个嵌入相似度度量网络以控制两个所选嵌入之间的相似度。我们进一步将这两种新方法与原网络联合训练并达到了当前最优(state-of-the-art)。多任务训练的协同效应体现为在 2016 NIST 说话人识别评测(SRE)测试集上等错误率(EER)与检测代价函数(DCF)降低 9%。

关键词

引用

@article{arxiv.1908.02283,
  title  = {Triplet Based Embedding Distance and Similarity Learning for Text-independent Speaker Verification},
  author = {Zongze Ren and Zhiyong Chen and Shugong Xu},
  journal= {arXiv preprint arXiv:1908.02283},
  year   = {2019}
}

备注

5 pages, Accepted to The Asia-Pacific Signal and Information Processing Association Annual Summit and Conference 2019 (APSIPA ASC 2019)