DuRep:通过 ASR 感知蒸馏实现的双模式语音表征学习
音频与语音处理
2025-05-27 v1
摘要
语音编码器的最新进展因其与大语言模型的集成以处理各种语音任务而备受关注。虽然大多数研究都集中在因果或全上下文语音编码器上,但在有效处理流式和非流式应用的同时达到最先进性能方面的探索有限。我们引入了 DuRep,一种双模式语音表征学习设置,它使单个语音编码器能够在下游任务中,无需额外参数或特定模式调整,即可在离线和在线两种模式下高效运行。我们的 2 亿参数双模式编码器 DuRep-200M,在多语言 ASR 任务上,其流式和非流式模式的性能分别比基线编码器提升了 12% 和 11.6%。将此方法扩展到 20 亿参数,DuRep-2B 在 ASR 和非 ASR 任务上均设立了新的性能基准。我们的分析揭示了编码器各层之间声学信息和语义信息的有趣权衡。
引用
@article{arxiv.2505.19774,
title = {DuRep: Dual-Mode Speech Representation Learning via ASR-Aware Distillation},
author = {Prabash Reddy Male and Swayambhu Nath Ray and Harish Arsikere and Akshat Jaiswal and Prakhar Swarup and Prantik Sen and Debmalya Chakrabarty and K V Vijay Girish and Nikhil Bhave and Frederick Weber and Sambuddha Bhattacharya and Sri Garimella},
journal= {arXiv preprint arXiv:2505.19774},
year = {2025}
}