中文

基于循环选择性注意力网络的连续语音分离

音频与语音处理 2021-10-29 v1 声音

摘要

尽管基于排列不变训练(PIT)的连续语音分离(CSS)显著提高了对话转写准确率,但由于其具有固定数量的输出通道,它常常遭受语音泄漏以及在“热点”区域分离失败的问题。在本文中,我们提出将循环选择性注意力网络(RSAN)应用于 CSS,其基于活跃说话人计数生成可变数量的输出通道。此外,我们提出了一种 RSAN 的新型块间依赖扩展,通过在 CSS 框架中引入相邻处理块之间的依赖关系。它使网络能够利用来自先前块的分离结果来促进当前块的处理。在 LibriCSS 数据集上的实验结果表明,基于 RSAN 的 CSS(RSAN-CSS)网络相比基于 PIT 的模型持续提高了语音识别准确率。所提出的块间依赖建模进一步提升了 RSAN-CSS 的性能。

关键词

引用

@article{arxiv.2110.14838,
  title  = {Continuous Speech Separation with Recurrent Selective Attention Network},
  author = {Yixuan Zhang and Zhuo Chen and Jian Wu and Takuya Yoshioka and Peidong Wang and Zhong Meng and Jinyu Li},
  journal= {arXiv preprint arXiv:2110.14838},
  year   = {2021}
}

备注

Submitted to ICASSP 2022