中文

AGADIR:迈向阵列几何无关的方向性语音识别

音频与语音处理 2024-01-22 v1 声音

摘要

智能眼镜等可穿戴设备正接近具备为实时对话无缝生成实时字幕的计算能力。我们基于最近引入的用于配备麦克风阵列的智能眼镜的方向性自动语音识别(ASR)进行研究,该技术将多通道 ASR 与序列输出训练相融合,用于佩戴者/对话伙伴的消歧,以及抑制来自非目标方向的串话语音和噪声。当 ASR 工作作为更广泛的系统开发过程的一部分时,随着系统开发的推进,可能会面临麦克风几何形状的变化。本文旨在使多通道 ASR 对麦克风阵列几何形状的有限变化不敏感。我们表明,在多种相似几何形状上训练的模型在很大程度上是无关的,并且只要新几何形状差异不大,就能很好地泛化到新几何形状。此外,以这种方式训练模型将已见几何形状的准确率相对提高了 15% 到 28%。最后,我们通过一种新颖的非线性约束最小方差准则改进了波束成形。

关键词

引用

@article{arxiv.2401.10411,
  title  = {AGADIR: Towards Array-Geometry Agnostic Directional Speech Recognition},
  author = {Ju Lin and Niko Moritz and Yiteng Huang and Ruiming Xie and Ming Sun and Christian Fuegen and Frank Seide},
  journal= {arXiv preprint arXiv:2401.10411},
  year   = {2024}
}

备注

Accepted to ICASSP 2024