Graph-PIT:用于任意数量说话人连续分离的广义排列不变训练
音频与语音处理
2021-09-21 v2 声音
摘要
会议自动转写需要处理重叠语音,这需要连续语音分离(CSS)系统。uPIT 准则被提出用于基于神经网络的语句级分离,并引入了总说话人数量不得超过输出通道数量的约束。当以分段方式处理类会议数据(即独立分离重叠段并将相邻段拼接为连续输出流)时,该约束必须在任意段上满足。在本文中,我们证明该约束可显著放宽。我们提出一种新颖的基于图的 PIT 准则,将语句到输出通道的分配转化为图着色问题。它仅要求同时活动的说话人数量不得超过输出通道数量。因此,系统可处理任意数量的说话人和任意长的段,从而能应对更多样化的场景。此外,用于在相邻段获得一致输出顺序的拼接算法变得不那么重要,甚至可完全消除,这至少减少了计算开销。在会议风格 WSJ 数据上的实验显示,相较使用 uPIT 准则,识别性能有所提升。
引用
@article{arxiv.2107.14446,
title = {Graph-PIT: Generalized permutation invariant training for continuous separation of arbitrary numbers of speakers},
author = {Thilo von Neumann and Keisuke Kinoshita and Christoph Boeddeker and Marc Delcroix and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2107.14446},
year = {2021}
}
备注
Accepted at INTERSPEECH 2021