中文

NEST: 自监督快速Conformer作为 speech processing 任务的全能调味料

声音 2025-01-22 v6 音频与语音处理

摘要

自监督学习已被证明能惊及广泛的语音处理任务,如语音识别/翻译、说话人验证和说话人分割等。然而,大多数现有方法计算开销巨大。本文提出一种简化且更高效的自监督学习框架,称为语音任务的NeMo编码器(NEST)。具体而言,我们采用8倍下采样率的FastConformer架构,其速度快于Transformer或Conformer架构。除基于聚类的量化方法外,我们使用固定随机投影以实现简单性和有效性。我们还实现了一种通用的噪声语音数据增强,教导模型从噪声或其他说话人中分离主说话人。实验表明,\model 在现有自监督模型基础上取得了改进,并在多种语音处理任务上实现了新的状态-of-the-art性能,如语音识别/翻译、说话人分割、说话语言理解等。代码和模型checkpoint可通过NVIDIA NeMo框架公开获取。

关键词

引用

@article{arxiv.2408.13106,
  title  = {NEST: Self-supervised Fast Conformer as All-purpose Seasoning to Speech Processing Tasks},
  author = {He Huang and Taejin Park and Kunal Dhawan and Ivan Medennikov and Krishna C. Puvvada and Nithin Rao Koluguri and Weiqing Wang and Jagadeesh Balam and Boris Ginsburg},
  journal= {arXiv preprint arXiv:2408.13106},
  year   = {2025}
}

备注

Published in ICASSP 2025