MFCCA:用于多方会议场景多说话人ASR的多帧跨通道注意力
声音
2022-10-12 v1 音频与语音处理
摘要
近来,能更好利用来自麦克风阵列的多通道信号的跨通道注意力,在多方会议场景中展现出可喜结果。跨通道注意力要么侧重于学习不同通道序列间的全局关联,要么在每个时间步有效挖掘细粒度通道信息。考虑到麦克风阵列接收声音的延迟,我们提出多帧跨通道注意力,其对相邻帧间的跨通道信息建模以利用帧级与通道级知识的互补性。此外,我们还提出多层卷积机制来融合多通道输出,以及一种通道掩蔽策略以应对训练与推理间通道数不匹配问题。在真实语料AliMeeting上的实验显示,我们所提模型在Eval与Test集上分别以31.7%和37.0%的CER下降优于单通道模型。而且,在模型参数与训练数据相当的情况下,相较于近期举办的多通道多说话人ASR挑战赛ICASSP2022 M2MeT中排名靠前的系统,我们所提模型在AliMeeting语料上取得了新的SOTA性能。
引用
@article{arxiv.2210.05265,
title = {MFCCA:Multi-Frame Cross-Channel attention for multi-speaker ASR in Multi-party meeting scenario},
author = {Fan Yu and Shiliang Zhang and Pengcheng Guo and Yuhao Liang and Zhihao Du and Yuxiao Lin and Lei Xie},
journal= {arXiv preprint arXiv:2210.05265},
year = {2022}
}
备注
Accepted by SLT 2022