中文

NIST SRE CTS Superset:用于电话语音说话人识别的大规模数据集

声音 2021-08-17 v1 人工智能 音频与语音处理 机器学习

摘要

本文档简要描述了美国国家标准与技术研究院(NIST)说话人识别评测(SRE)对话电话语音(CTS)Superset。创建 CTS Superset 旨在为研究界提供大规模数据集及统一元数据,以有效训练与开发电话(窄带)说话人识别系统。其包含来自 6800 余名说话人的大量电话语音片段,语音时长在 [10s, 60s] 范围内均匀分布。这些片段提取自用于编制既往 SRE 数据集(SRE1996-2012)的源语料库,包括 Greybeard 语料库以及由语言数据联盟(LDC)收集的 Switchboard 和 Mixer 系列。除简要描述外,我们还报告了在 NIST 2020 CTS 说话人识别挑战赛上使用以 CTS Superset 训练的系统所获得的说话人识别结果。该结果将作为该挑战赛的参考基线。

关键词

引用

@article{arxiv.2108.07118,
  title  = {NIST SRE CTS Superset: A large-scale dataset for telephony speaker recognition},
  author = {Seyed Omid Sadjadi},
  journal= {arXiv preprint arXiv:2108.07118},
  year   = {2021}
}