中文

说话人识别的里里外外:来自 VoxSRC 2020 的经验教训

声音 2020-10-30 v1 音频与语音处理

摘要

Interspeech 2020 上的 VoxCeleb 说话人识别挑战赛(VoxSRC)为说话人识别系统提供了一项具有挑战性的评测,其中包含名人在电影中扮演不同角色。本工作的目标是在这些具有挑战性的环境中对语音片段进行鲁棒说话人识别。我们利用流行的 ResNet 架构的变体进行说话人识别,并使用一系列损失函数和训练参数进行了广泛实验。为此,我们优化了一个高效的训练框架,使得强大的模型能够在有限的时间和资源下被训练。我们训练得到的模型以更轻量的模型和简单的流水线,展现出优于大多数现有工作的表现。本文分享了我们从参与该挑战赛中获得的经验教训。

关键词

引用

@article{arxiv.2010.15809,
  title  = {The ins and outs of speaker recognition: lessons from VoxSRC 2020},
  author = {Yoohwan Kwon and Hee-Soo Heo and Bong-Jin Lee and Joon Son Chung},
  journal= {arXiv preprint arXiv:2010.15809},
  year   = {2020}
}