在上下文端到端自动语音识别中使用外部离策略语音-文本映射
音频与语音处理
2023-01-10 v1 机器学习
声音
摘要
尽管自动语音识别(ASR)模型的泛化性能有所提升,但使ASR模型专用于下游任务仍具挑战,主要源于数据可用性降低(需增加数据采集)及数据分布快速偏移(需更频繁微调)。本工作中,我们探究利用外部知识的潜力,特别是通过文本转语音方法生成的离策略键值存储,以实现对新数据分布的灵活训练后适配。在我们的方法中,从文本转语音获取的音频嵌入与语义文本嵌入,通过基于近似k近邻(KNN)的注意力融合步骤来偏置ASR。在LibriSpeech与内部语音助手/搜索数据集上的实验表明,相较微调基线,所提方法可将领域适配时间减少多达1K GPU小时,同时提供高达3%的WER改进,显示出在零样本与少样本挑战场景中适配生产ASR系统的可行前景。
引用
@article{arxiv.2301.02736,
title = {Using External Off-Policy Speech-To-Text Mappings in Contextual End-To-End Automated Speech Recognition},
author = {David M. Chan and Shalini Ghosh and Ariya Rastrow and Björn Hoffmeister},
journal= {arXiv preprint arXiv:2301.02736},
year = {2023}
}