中文

用于神经说话人日志化的幂集多类交叉熵损失

声音 2023-10-23 v1 人工智能 计算与语言 神经与进化计算 音频与语音处理

摘要

自 2019 年提出以来,端到端神经日志化(EEND)系列工作一直将说话人日志化作为具有置换不变训练的逐帧多标签分类问题。尽管 EEND 展现出巨大潜力,近期若干工作退一步研究了(局部)有监督 EEND 日志化与(全局)无监督聚类的可能结合。然而,这些混合研究并未质疑原始的多标签表述。我们提出从多标签(任意两个说话人可同时活跃)转向幂集多类分类(为重叠说话人对分配专用类别)。通过在 9 个不同基准上的大量实验,我们表明该表述带来显著更优的性能(主要体现在重叠语音上)与对领域失配的鲁棒性,同时消除了对多标签表述至关重要的检测阈值超参数。

关键词

引用

@article{arxiv.2310.13025,
  title  = {Powerset multi-class cross entropy loss for neural speaker diarization},
  author = {Alexis Plaquet and Hervé Bredin},
  journal= {arXiv preprint arXiv:2310.13025},
  year   = {2023}
}