基于注意力的端到端印地语与英语语音搜索语音识别
音频与语音处理
2022-02-01 v1 信息检索
机器学习
声音
摘要
我们在此描述在Flipkart电子商务平台语音搜索功能背景下的自动语音识别(ASR)工作。从Listen-Attend-Spell(LAS)深度学习架构出发,我们构建并扩展模型设计与注意力机制,以纳入创新方法,包括多目标训练、多遍训练,以及使用语言模型与基于音素的损失进行外部重打分。使用这些改进,我们在最先进LAS模型基础上报告了15.7%的相对词错率(WER)提升。总体而言,我们报告了相比音素-CTC系统36.9%的提升。本文还概述了基于LAS的系统中可调节的不同组件。
引用
@article{arxiv.2111.10208,
title = {Attention based end to end Speech Recognition for Voice Search in Hindi and English},
author = {Raviraj Joshi and Venkateshan Kannan},
journal= {arXiv preprint arXiv:2111.10208},
year = {2022}
}
备注
Accepted at Forum for Information Retrieval Evaluation (FIRE) 2021