中文

统一的多通道远场语音识别系统:结合神经波束形成与基于注意力的端到端模型

音频与语音处理 2024-01-08 v1 人工智能 声音

摘要

远场语音识别是一项具有挑战性的任务,传统上使用信号处理波束形成来应对噪声和干扰问题。但由于对环境假设的严重依赖,性能通常有限。在本文中,我们提出了一种统一的多通道远场语音识别系统,该系统结合了神经波束形成和基于Transformer的Listen, Spell, Attend (LAS)语音识别系统,将端到端语音识别系统进一步扩展到包括语音增强。然后联合训练该框架以优化最终目标。具体地,采用因式复杂线性投影(fCLP)形成神经波束形成。比较了几种组合观察方向的池化策略以找到最优方法。此外,还将源方向信息集成到波束形成中,以探索源方向作为先验的有用性,这在多模态场景中通常是可用的。在不同麦克风阵列几何形状上进行了实验,以评估对麦克风阵列间距变化的鲁棒性。使用大型内部数据库评估所提框架的有效性,与强基线相比,所提方法实现了19.26%的改进。

关键词

引用

@article{arxiv.2401.02673,
  title  = {A unified multichannel far-field speech recognition system: combining neural beamforming with attention based end-to-end model},
  author = {Dongdi Zhao and Jianbo Ma and Lu Lu and Jinke Li and Xuan Ji and Lei Zhu and Fuming Fang and Ming Liu and Feijun Jiang},
  journal= {arXiv preprint arXiv:2401.02673},
  year   = {2024}
}