FT 增强的语音验证:面向英语口语教室环境的噪声鲁棒说话人验证
音频与语音处理
2025-09-01 v1
摘要
创建对教室噪声(如嘈杂语声噪声)具有鲁棒性的教室环境说话人验证(SV)系统,对于开发辅助教育环境的 AI 工具至关重要。在这项工作中,我们研究了使用增强的儿童数据集进行微调以将 x-vector 和 ECAPA-TDNN 适应于教室环境的有效性。我们证明,使用增强的儿童数据集进行微调在这方面非常有效,并且降低了 x-vector 和 ECAPA-TDNN 模型在教室数据集和儿童语音数据集上的等错误率(EER)。值得注意的是,与 ECAPA-TDNN 基线模型相比,该方法将 ECAPA-TDNN 模型在 MPT 数据集教室环境上的 EER 平均降低了一半(提升了 5%)。与基线相比,x-vector 模型在 NCTE 数据集教室环境上平均提升了 8%。
关键词
引用
@article{arxiv.2505.20222,
title = {FT-Boosted SV: Towards Noise Robust Speaker Verification for English Speaking Classroom Environments},
author = {Saba Tabatabaee and Jing Liu and Carol Espy-Wilson},
journal= {arXiv preprint arXiv:2505.20222},
year = {2025}
}
备注
Accepted to be presented at Interspeech 2025