神经说话人分割模型的概率性融合与校准
声音
2025-12-04 v3 人工智能
摘要
端到端神经分割(EEND)系统产生帧级概率性说话人活动估计,然而由于评估主要聚焦于说话人分割误差率(DER),这些置信得分的可靠性和校准程度 largely 被忽视。当融合多个分割系统时,DOVER-Lap仍是唯一在段级上进行硬决策的已建立方法。我们提议使用连续概率输出,这使得能够利用模型不确定性和不同架构之间的互补优势进行更高级的融合和校准。本文提出了首个针对EEND模型在概率水平上进行校准和融合的综合框架。我们研究了两种输出表述形式(多标签和幂集表示),并探讨其对校准和融合效果的影响。通过在CallHome双说话人基准上进行大量实验,我们展示,正确的校准即使针对单个模型也能显著改善(最多达到19%的相对DER降低),在某些情况下甚至能缓解缺乏域适应的问题。我们揭示了在幂集空间中进行联合校准始终优于独立的每个说话人的校准,融合显著优于单个模型,而Fuse-then-Calibrate顺序通常优于先校准后融合和未校准融合,同时只需校准单个组合模型。我们的 最佳配置在DER方面优于DOVER-Lap,同时提供了对下游应用至关重要的可靠置信估计。本工作提出了EEND系统在概率水平上进行融合的最佳实践,展示了利用软输出相对于硬决策的优势。
引用
@article{arxiv.2511.22696,
title = {Probabilistic Fusion and Calibration of Neural Speaker Diarization Models},
author = {Juan Ignacio Alvarez-Trejos and Sergio A. Balanya and Daniel Ramos and Alicia Lozano-Diez},
journal= {arXiv preprint arXiv:2511.22696},
year = {2025}
}