中文

基于神经日记化的多通道会话说话人分离

音频与语音处理 2023-11-16 v1 声音

摘要

在处理重叠语音时,自动语音识别(ASR)系统的性能会显著下降,因为它们是为单说话人语音设计的。为提升会话或会议环境下的 ASR 性能,通常采用连续说话人分离(CSS)。然而,CSS 需要较短的分离窗口以避免窗口内出现过多说话人,并对不连续语音段进行顺序分组。为克服这些局限,我们提出了一种用于会议环境的称为“基于神经日记化的说话人分离”(SSND)的新多通道框架。我们的方法利用端到端日记化系统识别各说话人的语音活动。通过利用估计的说话人边界,我们生成嵌入序列,进而将说话人分配至多说话人分离模型的输出。SSND 在日记化阶段而非分离过程中,通过基于位置的训练解决了说话人无关说话人分离的排列模糊问题。这一独特方法允许多个非重叠说话人被分配到同一输出流,从而能够高效处理长时段——这是 CSS 无法完成的任务。此外,SSND 天然适用于说话人属性 ASR。我们在开放的 LibriCSS 数据集上评估了所提出的日记化与分离方法,大幅推进了当前最优的日记化与 ASR 结果。

关键词

引用

@article{arxiv.2311.08630,
  title  = {Multi-channel Conversational Speaker Separation via Neural Diarization},
  author = {Hassan Taherian and DeLiang Wang},
  journal= {arXiv preprint arXiv:2311.08630},
  year   = {2023}
}

备注

10 pages, 4 figures