通过统计混合模型集成实现会议数据的同步说话人日志与分离
音频与语音处理
2025-02-25 v2
摘要
我们提出了一种对会议数据进行同步说话人日志和分离的方法。该方法由用于语音源分离的复角高斯混合模型(cACGMM)和用于说话人日志的冯·米塞斯-费舍尔混合模型(VMFMM)组成,二者在一个联合统计框架中工作。通过这种集成,空间和频谱信息都被用于说话人日志和分离。我们还开发了一种方法来统计会议片段中活跃说话人的数量,以支持分块处理。虽然会议中的说话人总数可能是已知的,但通常在每个片段层面是未知的。通过所提出的说话人计数方法,联合说话人日志和源分离可以逐段进行,并且解决了跨片段的排列问题,从而为未来的块在线处理铺平了道路。在LibriCSS语料库上的实验结果表明,在词错误率(WER)方面,无论是在片段层面还是在会议层面,集成方法都优于级联的说话人日志和语音增强方法。
关键词
引用
@article{arxiv.2410.21455,
title = {Simultaneous Diarization and Separation of Meetings through the Integration of Statistical Mixture Models},
author = {Tobias Cord-Landwehr and Christoph Boeddeker and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2410.21455},
year = {2025}
}
备注
Accepted at ICASSP2025