在模块化说话人日志中结合空间线索用于多通道多方会议
音频与语音处理
2024-09-26 v1 声音
摘要
尽管完全端到端的说话人日志系统近年来取得了显著进展,但模块化系统由于其更强的适应性和鲁棒性,在真实场景中往往能取得更优的结果。从历史上看,模块化说话人日志方法很少讨论如何利用多通道语音中的空间线索。本文提出了一种三阶段模块化系统,通过利用多通道语音中的空间线索为神经说话人日志(NSD)解码的每个阶段提供更准确的初始化,从而增强单通道神经说话人日志系统和识别性能:(1)对多通道语音进行重叠检测和连续语音分离(CSS),以获得更干净的单说话人语音片段进行聚类,随后进行第一遍NSD解码。(2)第一遍的结果初始化一个复角中心高斯混合模型(cACGMM)以估计多通道语音上的逐说话人掩码,并通过重叠相加和掩码转VAD,实现具有较低说话人错误率(SpkErr)的初始化,随后进行第二遍NSD解码。(3)第二遍解码结果用于引导源分离(GSS),识别并过滤包含少于一个词的短片段以获得更干净的语音片段,随后进行重新聚类和最终的NSD解码。我们展示了在CHiME-8 NOTSOFAR-1(自然办公室谈话者远场音频录音环境)挑战赛中逐步探索的评估结果,证明了我们系统的有效性及其对提高识别性能的贡献。我们的最终系统在挑战赛中获得了第一名。
引用
@article{arxiv.2409.16803,
title = {Incorporating Spatial Cues in Modular Speaker Diarization for Multi-channel Multi-party Meetings},
author = {Ruoyu Wang and Shutong Niu and Gaobin Yang and Jun Du and Shuangqing Qian and Tian Gao and Jia Pan},
journal= {arXiv preprint arXiv:2409.16803},
year = {2024}
}
备注
5 pages, Submitted to ICASSP 2025