利用对比学习增强统一流式与非流式模型
计算与语言
2023-06-02 v1 声音
音频与语音处理
摘要
统一流式与非流式语音识别模型因其全面的能力取得了巨大成功。在本文中,我们提出通过对比目标弥合流式与非流式模式之间固有的表示差距,从而提高统一模型的准确率。具体而言,流式与非流式模式在同一帧的顶层隐藏表示被视为正样本对,鼓励流式模式的表示接近其非流式对应表示。多个负样本从同一样本在非流式模式下的其余帧中随机选取。实验结果表明,所提出的方法在流式和非流式模式下均对统一模型取得了一致的改进。我们的方法在流式模式下实现了 4.66% 的 CER,在非流式模式下实现了 4.31% 的 CER,在 AISHELL-1 基准上创下了新的 SOTA。
引用
@article{arxiv.2306.00755,
title = {Enhancing the Unified Streaming and Non-streaming Model with Contrastive Learning},
author = {Yuting Yang and Yuke Li and Binbin Du},
journal= {arXiv preprint arXiv:2306.00755},
year = {2023}
}
备注
Accepted by INTERSPEECH 2023