中文

FT 增强的语音验证:面向英语口语教室环境的噪声鲁棒说话人验证

音频与语音处理 2025-09-01 v1

摘要

创建对教室噪声(如嘈杂语声噪声)具有鲁棒性的教室环境说话人验证(SV)系统,对于开发辅助教育环境的 AI 工具至关重要。在这项工作中,我们研究了使用增强的儿童数据集进行微调以将 x-vector 和 ECAPA-TDNN 适应于教室环境的有效性。我们证明,使用增强的儿童数据集进行微调在这方面非常有效,并且降低了 x-vector 和 ECAPA-TDNN 模型在教室数据集和儿童语音数据集上的等错误率(EER)。值得注意的是,与 ECAPA-TDNN 基线模型相比,该方法将 ECAPA-TDNN 模型在 MPT 数据集教室环境上的 EER 平均降低了一半(提升了 5%)。与基线相比,x-vector 模型在 NCTE 数据集教室环境上平均提升了 8%。

关键词

引用

@article{arxiv.2505.20222,
  title  = {FT-Boosted SV: Towards Noise Robust Speaker Verification for English Speaking Classroom Environments},
  author = {Saba Tabatabaee and Jing Liu and Carol Espy-Wilson},
  journal= {arXiv preprint arXiv:2505.20222},
  year   = {2025}
}

备注

Accepted to be presented at Interspeech 2025