中文

对Wav2Vec2嵌入在设备端单通道语音增强中的深入审视

音频与语音处理 2024-03-05 v1 人工智能 机器学习

摘要

自监督学习模型已被发现在某些语音任务(如自动语音识别、说话人识别、关键词检测等)中非常有效。虽然这些特征在语音识别及相关任务中无疑是有用的,但它们在语音增强系统中的效用尚未得到牢固确立,或许也未被正确理解。在本文中,我们研究了SSL表示在具有挑战性的条件下用于单通道语音增强的情况,并发现它们对增强任务几乎没有增加价值。我们的约束条件围绕设备端实时语音增强设计——模型是因果的,计算占用空间小。此外,我们关注低信噪比条件,在这种条件下此类模型难以提供良好的增强效果。为了系统地检查SSL表示如何影响此类增强模型的性能,我们提出了多种利用这些嵌入的技术,包括不同形式的知识蒸馏和预训练。

关键词

引用

@article{arxiv.2403.01369,
  title  = {A Closer Look at Wav2Vec2 Embeddings for On-Device Single-Channel Speech Enhancement},
  author = {Ravi Shankar and Ke Tan and Buye Xu and Anurag Kumar},
  journal= {arXiv preprint arXiv:2403.01369},
  year   = {2024}
}

备注

8 pages; Shorter form accepted in ICASSP 2024