中文

基于自监督表示的跨域语音活动检测

音频与语音处理 2022-09-23 v1 人机交互 机器学习

摘要

语音活动检测(VAD)旨在检测音频信号中的语音段,这是当今许多基于语音应用的必要第一步。当前最先进的方法侧重于训练神经网络以利用声学中直接包含的特征,例如梅尔滤波器组(MFBs)。因此这类方法需要额外的归一化步骤来适应声学受到影响的新的域,而这仅可能是由于说话人、麦克风或环境的变化引起。此外,该归一化步骤通常是一种相当初级的方法,具有某些局限性,例如高度易受新域可用数据量的影响。在此,我们利用众包的 Common Voice(CV)语料库表明,基于自监督学习(SSL)的表示能够很好地适应不同域,因为它们是通过跨多个域的语音上下文化表示计算得到的。SSL 表示也取得了比基于手工设计表示(MFBs)的系统以及现成 VAD 更好的结果,在跨域设定下有显著改进。

关键词

引用

@article{arxiv.2209.11061,
  title  = {Cross-domain Voice Activity Detection with Self-Supervised Representations},
  author = {Sina Alisamir and Fabien Ringeval and Francois Portet},
  journal= {arXiv preprint arXiv:2209.11061},
  year   = {2022}
}