NIST SRE CTS Superset:用于电话语音说话人识别的大规模数据集
声音
2021-08-17 v1 人工智能
音频与语音处理
机器学习
摘要
本文档简要描述了美国国家标准与技术研究院(NIST)说话人识别评测(SRE)对话电话语音(CTS)Superset。创建 CTS Superset 旨在为研究界提供大规模数据集及统一元数据,以有效训练与开发电话(窄带)说话人识别系统。其包含来自 6800 余名说话人的大量电话语音片段,语音时长在 [10s, 60s] 范围内均匀分布。这些片段提取自用于编制既往 SRE 数据集(SRE1996-2012)的源语料库,包括 Greybeard 语料库以及由语言数据联盟(LDC)收集的 Switchboard 和 Mixer 系列。除简要描述外,我们还报告了在 NIST 2020 CTS 说话人识别挑战赛上使用以 CTS Superset 训练的系统所获得的说话人识别结果。该结果将作为该挑战赛的参考基线。
引用
@article{arxiv.2108.07118,
title = {NIST SRE CTS Superset: A large-scale dataset for telephony speaker recognition},
author = {Seyed Omid Sadjadi},
journal= {arXiv preprint arXiv:2108.07118},
year = {2021}
}