中文

利用自监督学习离散化输入探索高效端到端ASR

声音 2023-05-30 v1 音频与语音处理

摘要

语音的自监督学习(SSL)在语音相关任务中展现出令人印象深刻的成果,尤其在自动语音识别(ASR)中。虽然多数方法采用SSL模型中间层的输出作为实值特征用于下游任务,但探索使用离散化令牌序列的替代方法具有潜力。该方法具有更低存储需求和可应用自然语言处理技术等好处。本文提出一种在ASR任务中使用离散化令牌序列的新协议,包括去重与子词建模以增强输入序列。它通过缩短序列长度降低计算成本。我们在LibriSpeech数据集上的实验表明,所提协议在使用连续输入特征的常规ASR系统上具有竞争力,同时降低了计算与存储成本。

关键词

引用

@article{arxiv.2305.18108,
  title  = {Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning},
  author = {Xuankai Chang and Brian Yan and Yuya Fujita and Takashi Maekaku and Shinji Watanabe},
  journal= {arXiv preprint arXiv:2305.18108},
  year   = {2023}
}

备注

Accepted at INTERSPEECH 2023