探索用于会议转录的带偏置信息的端到端多通道ASR
音频与语音处理
2020-11-30 v2 声音
摘要
多通道前端与自动语音识别(ASR)的联合优化已引起广泛关注。尽管各项任务均报告了有前景的结果,以往关于其会议转录应用的研究仅限于小规模实验。尚不清楚此类联合框架是否有利于更实际的设置,即可以利用大量单通道训练数据构建强大的ASR后端。在本工作中,我们研究了掩码波束成形器与基于Attention-Encoder-Decoder的ASR的联合建模,设置中我们拥有75k小时单通道数据和相对较少的真实多通道数据用于模型训练。我们探索了有效的训练流程,包括模拟与真实多通道训练数据的比较。为引导识别朝向目标说话人并处理重叠语音,我们还探索了偏置信息的各种组合,如到达方向和说话人配置文件。我们提出了一种称为深度拼接的有效位置偏置集成方法用于波束成形器网络。在各类会议录音的评估中,我们显示所提框架实现了显著的词错误率降低。
引用
@article{arxiv.2011.03110,
title = {Exploring End-to-End Multi-channel ASR with Bias Information for Meeting Transcription},
author = {Xiaofei Wang and Naoyuki Kanda and Yashesh Gaur and Zhuo Chen and Zhong Meng and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2011.03110},
year = {2020}
}
备注
Accepted to SLT2021