VarArray:与阵列几何无关的连续语音分离
音频与语音处理
2021-10-27 v2 计算与语言
机器学习
声音
摘要
使用麦克风阵列的连续语音分离在自然对话转写中的语音重叠问题上已显示出良好前景。本文提出 VarArray,一种与阵列几何无关的语音分离神经网络模型。所提模型适用于任意数量的麦克风且无需重新训练,同时利用输入通道间的非线性相关性。该方法调整了此前分别提出的多个不同组件,包括变换-平均-拼接、conformer 语音分离和通道间相位差,并以高效且统一的方式将其结合。通过使用一个无需先验知识(如参考分割)的完整转写系统,在两个真实会议转写任务上进行了大规模评估,使我们能够衡量连续语音分离系统在实际场景中的影响。所提模型在所有考虑的几何配置下均优于此前的一种与阵列几何无关的建模方法,在端到端设置且不使用真实分割的情况下,于 AMI 开发集和评估集上分别取得了基于 asclite 的说话人无关词错误率 17.5% 和 20.4%。
引用
@article{arxiv.2110.05745,
title = {VarArray: Array-Geometry-Agnostic Continuous Speech Separation},
author = {Takuya Yoshioka and Xiaofei Wang and Dongmei Wang and Min Tang and Zirun Zhu and Zhuo Chen and Naoyuki Kanda},
journal= {arXiv preprint arXiv:2110.05745},
year = {2021}
}
备注
5 pages, 1 figure, 3 tables, submitted to ICASSP 2022; updated reference information of [33]