中文

基于三元组损失的嵌入方法用于西班牙语法庭说话人识别

声音 2021-09-15 v2 人工智能 音频与语音处理

摘要

随着数字技术的出现,所犯罪行或法律纠纷涉及某种形式语音录音且说话人身份受质疑的情况更为常见[1]。面对这种情况,法庭说话人识别领域一直试图通过量化一段语音录音相对于某一人群属于特定个人的程度来阐明该问题。在本工作中,我们探索通过使用三元组损失训练 CNN 所获得的语音嵌入的用途。特别地,我们关注尚未被广泛研究的西班牙语。我们提出从语音频谱图样本中抽取嵌入,进而探索此类频谱图的若干配置,并最终量化嵌入质量。我们还展示了我们数据设置的一些局限性,该数据主要由男性说话人构成。最后,我们提出两种基于所得语音嵌入计算似然比(Likelihood Radio)的方法,并表明三元组损失是为法庭说话人识别创建语音嵌入的良好替代方案。

关键词

引用

@article{arxiv.2102.12564,
  title  = {Triplet loss based embeddings for forensic speaker identification in Spanish},
  author = {Emmanuel Maqueda and Javier Alvarez-Jimenez and Carlos Mena and Ivan Meza},
  journal= {arXiv preprint arXiv:2102.12564},
  year   = {2021}
}

备注

Long Paper: Neural Computing and Applications, Special Issue on LatinX in AI Research (2021). 11 pages, 5 figures