中文

基于自组织麦克风阵列的连续语音分离

声音 2021-03-04 v1 人工智能 机器学习 音频与语音处理 信号处理

摘要

语音分离已被证明对多说话人语音识别有效。在由空间分布异步麦克风组成的自组织麦克风阵列设置下,由于阵列的几何结构和麦克风数量事先未知,必须克服额外的挑战。先前研究表明,借助时空交错结构,神经网络可高效利用自组织阵列的多通道信号。本文中,我们进一步将该方法扩展到连续语音分离。引入了若干技术以实现对真实连续录音的语音分离。首先,我们应用基于 transformer 的网络对自组织阵列信号进行时空建模。此外,提出了两种方法来缓解单说话人片段期间的语音重复问题,该问题在自组织阵列场景中似乎更为严重。一种方法是设备失真模拟,用于减少模拟训练数据与真实录音之间的声学失配。另一种是说话人计数,用于检测单说话人片段并合并输出信号通道。针对 AdHoc-LibiCSS(一个由多个不同设备获取的 LibriSpeech 语句拼接连续录音组成的新数据集)的实验结果表明,所提分离方法能显著提升重叠语音的 ASR 准确率,且对单说话人片段性能下降很小。

关键词

引用

@article{arxiv.2103.02378,
  title  = {Continuous Speech Separation with Ad Hoc Microphone Arrays},
  author = {Dongmei Wang and Takuya Yoshioka and Zhuo Chen and Xiaofei Wang and Tianyan Zhou and Zhong Meng},
  journal= {arXiv preprint arXiv:2103.02378},
  year   = {2021}
}