基于 Seq-2-Seq 的 ASR 输出精修用于口语姓名捕获
计算与语言
2022-03-31 v1 音频与语音处理
摘要
从人类语音中捕获人名是人机对话中的一项困难任务。在本文中,我们提出一种新方法,用于在响应提示“说出并拼出您的名/姓”时从呼叫者话语中捕获人名。受拼写纠正、不流畅去除和文本规范化工作的启发,我们提出了一种轻量级 Seq-2-Seq 系统,该系统从变化的用户输入生成姓名拼写。我们提出的方法优于基于 LM 驱动的基于规则方法的强基线。
引用
@article{arxiv.2203.15833,
title = {Seq-2-Seq based Refinement of ASR Output for Spoken Name Capture},
author = {Karan Singla and Shahab Jalalvand and Yeon-Jun Kim and Ryan Price and Daniel Pressel and Srinivas Bangalore},
journal= {arXiv preprint arXiv:2203.15833},
year = {2022}
}
备注
Under review at InterSpeech 2022