利用自监督学习离散化输入探索高效端到端ASR
声音
2023-05-30 v1 音频与语音处理
摘要
语音的自监督学习(SSL)在语音相关任务中展现出令人印象深刻的成果,尤其在自动语音识别(ASR)中。虽然多数方法采用SSL模型中间层的输出作为实值特征用于下游任务,但探索使用离散化令牌序列的替代方法具有潜力。该方法具有更低存储需求和可应用自然语言处理技术等好处。本文提出一种在ASR任务中使用离散化令牌序列的新协议,包括去重与子词建模以增强输入序列。它通过缩短序列长度降低计算成本。我们在LibriSpeech数据集上的实验表明,所提协议在使用连续输入特征的常规ASR系统上具有竞争力,同时降低了计算与存储成本。
引用
@article{arxiv.2305.18108,
title = {Exploration of Efficient End-to-End ASR using Discretized Input from Self-Supervised Learning},
author = {Xuankai Chang and Brian Yan and Yuya Fujita and Takashi Maekaku and Shinji Watanabe},
journal= {arXiv preprint arXiv:2305.18108},
year = {2023}
}
备注
Accepted at INTERSPEECH 2023