中文

MFCCA:用于多方会议场景多说话人ASR的多帧跨通道注意力

声音 2022-10-12 v1 音频与语音处理

摘要

近来,能更好利用来自麦克风阵列的多通道信号的跨通道注意力,在多方会议场景中展现出可喜结果。跨通道注意力要么侧重于学习不同通道序列间的全局关联,要么在每个时间步有效挖掘细粒度通道信息。考虑到麦克风阵列接收声音的延迟,我们提出多帧跨通道注意力,其对相邻帧间的跨通道信息建模以利用帧级与通道级知识的互补性。此外,我们还提出多层卷积机制来融合多通道输出,以及一种通道掩蔽策略以应对训练与推理间通道数不匹配问题。在真实语料AliMeeting上的实验显示,我们所提模型在Eval与Test集上分别以31.7%和37.0%的CER下降优于单通道模型。而且,在模型参数与训练数据相当的情况下,相较于近期举办的多通道多说话人ASR挑战赛ICASSP2022 M2MeT中排名靠前的系统,我们所提模型在AliMeeting语料上取得了新的SOTA性能。

关键词

引用

@article{arxiv.2210.05265,
  title  = {MFCCA:Multi-Frame Cross-Channel attention for multi-speaker ASR in Multi-party meeting scenario},
  author = {Fan Yu and Shiliang Zhang and Pengcheng Guo and Yuhao Liang and Zhihao Du and Yuxiao Lin and Lei Xie},
  journal= {arXiv preprint arXiv:2210.05265},
  year   = {2022}
}

备注

Accepted by SLT 2022