语音模型中用于大写恢复与话轮转换预测的文本注入
计算与语言
2023-08-16 v1 机器学习
声音
音频与语音处理
摘要
用于自动语音识别(ASR)的文本注入,即利用未配对的纯文本数据来补充配对的音频-文本数据,已在词错误率方面展现出有前景的改进。本研究考察了文本注入在辅助任务中的使用,这些辅助任务通常是由端到端(E2E)模型执行的非 ASR 任务。在这项工作中,我们采用联合端到端与内部语言模型训练(JEIT)作为文本注入算法,训练一个执行两项辅助任务的 ASR 模型。第一项是大写恢复,这是一个反归一化任务。第二项是对话话轮转换预测,其试图识别用户在数字助手交互中是否已完成其对话话轮。我们展示的结果表明,我们的文本注入方法提升了长尾数据的大写恢复性能,并改善了话轮转换检测的召回率。
引用
@article{arxiv.2308.07395,
title = {Text Injection for Capitalization and Turn-Taking Prediction in Speech Models},
author = {Shaan Bijwadia and Shuo-yiin Chang and Weiran Wang and Zhong Meng and Hao Zhang and Tara N. Sainath},
journal= {arXiv preprint arXiv:2308.07395},
year = {2023}
}