中文

LibriVAD:面向语音活动检测的可扩展开放数据集与深度学习基准

声音 2025-12-22 v1 机器学习

摘要

鲁棒语音活动检测(VAD)仍是一个充满挑战的任务,尤其是在嘈杂、多样且不可见的声学条件下。除了算法开发之外,推进 VAD 研究的关键限制是缺乏大规模、系统受控且公开可用的数据集。为此,我们介绍 LibriVAD——一个源自 LibriSpeech 并增强了多样化真实世界和合成噪声来源的可扩展开放数据集。LibriVAD 允许对语音信噪比、静默信噪比(SSR)以及噪声多样性进行系统性控制,并以三个规模(15 GB、150 GB 和 1.5 TB)和两个变体(LibriVAD-NonConcat 和 LibriVAD-Concat)的形式发布,以支持不同的实验设置。我们对多种特征-模型组合进行基准测试,包括波形、梅尔频率倒谱系数(MFCC)和高尔夫曼滤波器组倒谱系数,并为 VAD 引入了视觉转换器(Vision Transformer, ViT)架构。我们的实验表明,在看到的情况、未看到的情况以及超出分布(Out-of-Distribution, OOD)条件下,包括在真实世界的 VOiCES 数据集上的评估,ViT 与 MFCC 特征的组合始终优于提升的深度神经网络和卷积长短期记忆深度神经网络等已建立的 VAD 模型。我们进一步分析了数据集规模和 SSR 对模型泛化的影响,实验结果表明,扩大数据集规模并平衡 SSR 可显著且持续地提高在 OOD 条件下的 VAD 性能。所有数据集、训练好的模型和代码均公开释放,以促进可重复性并加速 VAD 研究的进展。

关键词

引用

@article{arxiv.2512.17281,
  title  = {LibriVAD: A Scalable Open Dataset with Deep Learning Benchmarks for Voice Activity Detection},
  author = {Ioannis Stylianou and Achintya kr. Sarkar and Nauman Dawalatabad and James Glass and Zheng-Hua Tan},
  journal= {arXiv preprint arXiv:2512.17281},
  year   = {2025}
}