关于 powerset 说话人二次判别模型校准的研究
声音
2024-09-25 v1 机器学习
音频与语音处理
摘要
端到端神经二次判别模型通常依赖于多标签分类方法来表述说话人二次判别问题。最近,我们提出了一种 powerset 多类方法,在多个数据集上击败了最先进技术。在本文中,我们提出研究 powerset 说话人二次判别模型的校准,并探索其用途。我们研究了模型在同一领域内外的校准情况,并探讨了低置信度区域的数据。模型置信度的可靠性随后被实际测试:我们使用预训练模型的置信度来有选择地从未标注的数据中创建训练和验证子集,并与随机选择进行比较。我们发现,顶层置信度可以可靠地预测高错误区域。此外,在低置信度区域进行训练可提供更好的校准模型,在低置信度区域进行验证比随机区域更高效。
引用
@article{arxiv.2409.15885,
title = {On the calibration of powerset speaker diarization models},
author = {Alexis Plaquet and Hervé Bredin},
journal= {arXiv preprint arXiv:2409.15885},
year = {2024}
}