中文

噪声教室的多阶段说话人分割

声音 2025-05-28 v2 机器学习 音频与语音处理

摘要

说话人分割是识别音频记录中"谁在何时说话"的过程,这对于理解教室动态至关重要。然而,教室环境 presents distinct 挑战,包括录音质量差、背景噪声水平高、语音重叠以及难以准确捕捉儿童声音。本研究检验了使用 Nvidia NeMo 分割管道的多阶段分割模型的有效性。我们评估了去噪对分割准确性的影响,并比较了各种语音活动检测 (VAD) 模型,包括自监督基于 Transformer 的帧级 VAD 模型。我们还探索了将自动语音识别 (ASR) 单词级时间戳与帧级 VAD 预测相结合的混合 VAD 方法。我们使用来自英语教室的两个数据集进行实验,以区分教师与学生的语音以及所有说话人。我们的结果表明,去噪显著改善了说话人分割错误率 (DER),通过减少漏报语音的比例。此外,在训练时使用去噪和噪声数据集可显著提升在噪声条件下的性能。混合 VAD 模型实现了对语音检测的进一步改进,在教师-学生实验中实现了最低 17% 的 DER,在所有说话人实验中实现了 45%。然而,我们也确定语音活动检测与说话人混淆之间的权衡。总体而言,我们的研究突显了多阶段分割模型的有效性以及集成 ASR 信息用于增强噪声教室环境中说话人分割的重要性。

关键词

引用

@article{arxiv.2505.10879,
  title  = {Multi-Stage Speaker Diarization for Noisy Classrooms},
  author = {Ali Sartaz Khan and Tolulope Ogunremi and Ahmed Adel Attia and Dorottya Demszky},
  journal= {arXiv preprint arXiv:2505.10879},
  year   = {2025}
}