XMUSPEECH 系统用于多通道多方会议转录挑战赛
音频与语音处理
2022-02-14 v1 声音
摘要
本文描述了 XMUSPEECH 团队为多通道多方会议转录挑战赛(M2MeT)开发的系统。对于说话人日志任务,我们提出了一种多通道说话人日志系统,通过到达方向差(DOA)技术获取说话人的空间信息。说话人-空间嵌入由 x-vector 与源自滤波求和波束成形(FSB)的 s-vector 生成,使嵌入更鲁棒。具体而言,我们提出了一种名为判别多流神经网络(DMSNet)的新型多通道序列到序列神经网络架构,其由注意力滤波求和块(AFSB)与 Conformer 编码器组成。我们探索利用 DMSNet 解决多通道音频中的重叠语音问题。与基于 LSTM 的 OSD 模块相比,我们的检测错误率(DetER)降低了 10.1%。通过采用基于 DMSNet 的 OSD 模块,基于聚类的日志系统的 DER 从 13.44% 显著下降至 7.63%。我们最佳的融合系统在评估集与测试集上分别取得了 7.09% 与 9.80% 的说话人日志错误率(DER)。
引用
@article{arxiv.2202.05744,
title = {The xmuspeech system for multi-channel multi-party meeting transcription challenge},
author = {Jie Wang and Yuji Liu and Binling Wang and Yiming Zhi and Song Li1 and Shipeng Xia and Jiayang Zhang and Lin Li1 and Qingyang Hong and Feng Tong},
journal= {arXiv preprint arXiv:2202.05744},
year = {2022}
}