ZeroPrompt:流式声学编码器即零样本掩码语言模型
声音
2023-10-10 v1 计算与语言
音频与语音处理
摘要
在本文中,我们提出 ZeroPrompt(图1-(a))及相应的 Prompt-and-Refine 策略(图3),这两种简单但有效的\textbf{免训练}方法可在\textbf{不损失任何精度}的情况下降低流式 ASR 模型的令牌显示时间(TDT)。ZeroPrompt 的核心思想是在推理时向每个分块追加零值内容,其充当提示以鼓励模型在将来令牌被说出之前就进行预测。我们认为流式声学编码器天然具有掩码语言模型的建模能力,并且我们的实验表明 ZeroPrompt 工程成本低,可应用于任意数据集上的流式声学编码器且不损失任何精度。具体而言,与我们的基线模型相比,我们在 Aishell-1 和 Librispeech 数据集上分别实现了首令牌显示时间(TDT-F)减少 350 700ms、末令牌显示时间(TDT-L)减少 100 400ms,且词错率(WER)在理论和实验上均相等。
引用
@article{arxiv.2305.10649,
title = {ZeroPrompt: Streaming Acoustic Encoders are Zero-Shot Masked LMs},
author = {Xingchen Song and Di Wu and Binbin Zhang and Zhendong Peng and Bo Dang and Fuping Pan and Zhiyong Wu},
journal= {arXiv preprint arXiv:2305.10649},
year = {2023}
}
备注
accepted by interspeech 2023