中文

面向 ICASSP 2022 多通道多方会议转录挑战赛的 Royalflush 说话人日志系统

声音 2022-02-21 v2 人工智能 音频与语音处理

摘要

本文描述了提交至多通道多方会议转录挑战赛 (M2MeT) 的 Royalflush 说话人日志系统。我们的系统包括语音增强、重叠语音检测、说话人嵌入提取、说话人聚类、语音分离和系统融合。在该系统中,我们做出了三项贡献。首先,我们提出了一种结合多通道和基于 U-Net 模型的架构,旨在利用这两种独立架构的优势,用于远场重叠语音检测。其次,为了使用重叠语音检测模型来辅助说话人日志,提出了一种基于语音分离的重叠语音处理方法,其中进一步应用了说话人验证技术。第三,我们探索了三种说话人嵌入方法,并在 CNCeleb-E 测试集上获得了 SOTA 性能。凭借这些提案,我们最佳的单系统将 DER 从 15.25% 显著降低至 6.40%,并且四个系统的融合最终在远场 Alimeeting 评估集上实现了 6.30% 的 DER。

关键词

引用

@article{arxiv.2202.04814,
  title  = {Royalflush Speaker Diarization System for ICASSP 2022 Multi-channel Multi-party Meeting Transcription Challenge},
  author = {Jingguang Tian and Xinhui Hu and Xinkang Xu},
  journal= {arXiv preprint arXiv:2202.04814},
  year   = {2022}
}