中文

NIST CTS 说话人识别挑战赛

音频与语音处理 2022-04-22 v1 机器学习 声音 机器学习

摘要

美国国家标准与技术研究院(NIST)自 2020 年 8 月以来一直在开展 CTS 挑战赛的第二轮迭代。当前迭代的 CTS 挑战赛是一项排行榜式说话人识别评测,使用从 LDC 收集的 Call My Net 2(CMN2)与多语言语音(MLS)语料库未暴露部分提取的电话数据。CTS 挑战赛目前以类似于 SRE19 CTS 挑战赛的方式组织,仅提供使用两个评测子集(即 Progress 与 Test)的开放训练条件。与 SRE19 挑战赛不同,最初未发布训练或开发集,且 NIST 已公开发布 CTS 挑战赛在两个子集上的排行榜。试验所属子集(即 Progress 或 Test)对挑战赛参与者未知,且每次系统提交须包含所有试验的输出。CTS 挑战赛也已并将继续作为进入常规 SRE(如 SRE21)的先决条件。自 2020 年 8 月以来,来自学术界与工业界的共 53 家机构(组成 33 支队伍)参与了 CTS 挑战赛,提交了超过 4400 份有效系统输出。本文给出评测概述及对 CTS 挑战赛中若干主要条件下系统表现的若干分析。迄今 CTS 挑战赛结果表明性能显著提升源于:1)使用大规模复杂神经网络架构(如 ResNet)配合角间隔损失提取说话人嵌入;2)广泛的数据增强;3)使用来自大量标注说话人的海量内部专有数据;4)长时长微调。

关键词

引用

@article{arxiv.2204.10228,
  title  = {The NIST CTS Speaker Recognition Challenge},
  author = {Seyed Omid Sadjadi and Craig Greenberg and Elliot Singer and Lisa Mason and Douglas Reynolds},
  journal= {arXiv preprint arXiv:2204.10228},
  year   = {2022}
}