真实场景下的说话人识别
声音
2022-05-06 v1 计算与语言
音频与语音处理
摘要
在本文中,我们提出一种流水线方法,用于在音频数据源中找出说话人数量以及属于这些已识别说话人的音频,其中说话人数量或说话人标签事先未知。我们将其作为印度语言语音识别数据准备流水线的一部分使用(https://github.com/Open-Speech-EkStep/vakyansh-wav2vec2-experimentation)。为理解和评估所提流水线的准确性,我们引入两个指标:簇纯度(Cluster Purity)和簇唯一性(Cluster Uniqueness)。簇纯度量化一个簇的“纯净”程度。另一方面,簇唯一性量化仅属于单一主导说话人的簇的百分比。我们在第 \ref{sec:metrics} 节详细讨论这些指标。由于我们开发该工具是为了在训练自动语音识别(ASR)模型前依据说话人 ID 识别数据,且此类数据大多需耗费大量精力抓取,我们还得出结论:在所选测试集中,98% 的数据被映射到前 80% 的簇(通过移除少于固定数量语句的簇计算——我们以此剔除极小簇并将该阈值设为 30)。
引用
@article{arxiv.2205.02475,
title = {Speaker Recognition in the Wild},
author = {Neeraj Chhimwal and Anirudh Gupta and Rishabh Gaur and Harveen Singh Chadha and Priyanshi Shah and Ankur Dhuriya and Vivek Raghavan},
journal= {arXiv preprint arXiv:2205.02475},
year = {2022}
}
备注
This paper was submitted to Interspeech 2022