端侧流式离散语音单元
音频与语音处理
2025-06-03 v1 机器学习
声音
摘要
离散语音单元(DSUs)通过对自监督语音模型(S3Ms)的特征进行聚类派生而来。由于其丰富的语音信息、高传输效率以及与大型语言模型的无缝集成,DSUs为端侧流式语音应用提供了显著优势。然而,传统的基于DSU的方法并不实用,因为它们需要全长语音输入且计算S3Ms的成本高昂。在本工作中,我们在保持DSUs有效性的同时,缩短了注意力窗口并减小了模型大小。我们的结果表明,在ML-SUPERB 1h数据集上,我们可以将浮点运算次数减少50%,而字符错误率(CER)仅相对增加6.5%。这些发现突显了DSUs在资源受限环境中用于实时语音处理的潜力。
引用
@article{arxiv.2506.01845,
title = {On-device Streaming Discrete Speech Units},
author = {Kwanghee Choi and Masao Someki and Emma Strubell and Shinji Watanabe},
journal= {arXiv preprint arXiv:2506.01845},
year = {2025}
}
备注
Accepted to Interspeech 2025, source code at https://github.com/Masao-Someki/StreamingDSU