中文

基于 Seq-2-Seq 的 ASR 输出精修用于口语姓名捕获

计算与语言 2022-03-31 v1 音频与语音处理

摘要

从人类语音中捕获人名是人机对话中的一项困难任务。在本文中,我们提出一种新方法,用于在响应提示“说出并拼出您的名/姓”时从呼叫者话语中捕获人名。受拼写纠正、不流畅去除和文本规范化工作的启发,我们提出了一种轻量级 Seq-2-Seq 系统,该系统从变化的用户输入生成姓名拼写。我们提出的方法优于基于 LM 驱动的基于规则方法的强基线。

关键词

引用

@article{arxiv.2203.15833,
  title  = {Seq-2-Seq based Refinement of ASR Output for Spoken Name Capture},
  author = {Karan Singla and Shahab Jalalvand and Yeon-Jun Kim and Ryan Price and Daniel Pressel and Srinivas Bangalore},
  journal= {arXiv preprint arXiv:2203.15833},
  year   = {2022}
}

备注

Under review at InterSpeech 2022