中文

语音模型中用于大写恢复与话轮转换预测的文本注入

计算与语言 2023-08-16 v1 机器学习 声音 音频与语音处理

摘要

用于自动语音识别(ASR)的文本注入,即利用未配对的纯文本数据来补充配对的音频-文本数据,已在词错误率方面展现出有前景的改进。本研究考察了文本注入在辅助任务中的使用,这些辅助任务通常是由端到端(E2E)模型执行的非 ASR 任务。在这项工作中,我们采用联合端到端与内部语言模型训练(JEIT)作为文本注入算法,训练一个执行两项辅助任务的 ASR 模型。第一项是大写恢复,这是一个反归一化任务。第二项是对话话轮转换预测,其试图识别用户在数字助手交互中是否已完成其对话话轮。我们展示的结果表明,我们的文本注入方法提升了长尾数据的大写恢复性能,并改善了话轮转换检测的召回率。

关键词

引用

@article{arxiv.2308.07395,
  title  = {Text Injection for Capitalization and Turn-Taking Prediction in Speech Models},
  author = {Shaan Bijwadia and Shuo-yiin Chang and Weiran Wang and Zhong Meng and Hao Zhang and Tara N. Sainath},
  journal= {arXiv preprint arXiv:2308.07395},
  year   = {2023}
}