中文

会话语音分离:面向流式应用的评估研究

音频与语音处理 2022-06-01 v1

摘要

连续语音分离 (CSS) 是近来提出的一种框架,旨在以流式方式从输入混合信号中分离各说话人。此后我们对 CSS 系统的实际设计考量进行了评估研究,探讨了近期工作中被忽视的重要方面。特别地,我们关注分离性能、计算需求与输出延迟之间的权衡,展示如何将离线分离算法用于以所需延迟执行 CSS。我们就稀疏重叠数据上 CSS 处理窗口大小与跳移大小的选取开展了广泛分析。我们发现,对于 5 秒的窗口,在计算负担与性能之间取得了最佳权衡。

关键词

引用

@article{arxiv.2205.15700,
  title  = {Conversational Speech Separation: an Evaluation Study for Streaming Applications},
  author = {Giovanni Morrone and Samuele Cornell and Enrico Zovato and Alessio Brutti and Stefano Squartini},
  journal= {arXiv preprint arXiv:2205.15700},
  year   = {2022}
}

备注

Audio Engineering Society Convention 152, May 2022, The Hague, Netherlands