利用真实对话数据实现多通道连续语音分离
音频与语音处理
2022-04-08 v1 人工智能
信号处理
摘要
现有的多通道连续语音分离(CSS)模型严重依赖监督数据——要么是造成训练与真实数据测试之间数据失配的仿真数据,要么是难以获取的真实转写重叠数据——这阻碍了对话/会议转写任务的进一步提升。本文提出一种 CSS 模型的三阶段训练方案,可同时利用监督数据与额外的大规模无监督真实世界对话数据。该方案由两种常规训练方法——使用仿真数据的预训练以及使用转写数据的基于 ASR 损失的训练——以及两者之间的一种新颖连续半监督训练组成,其中 CSS 模型基于师生学习框架利用真实数据进一步训练。我们将该方案应用于一种阵列几何无关(array-geometry-agnostic)的 CSS 模型,其可使用任意麦克风阵列采集的多通道数据。在微软内部会议数据与 AMI 会议语料库上进行了大规模会议转写实验。观察到每个训练阶段带来的稳步提升,显示了所提方法能够有效利用真实对话数据训练 CSS 模型。
引用
@article{arxiv.2204.03232,
title = {Leveraging Real Conversational Data for Multi-Channel Continuous Speech Separation},
author = {Xiaofei Wang and Dongmei Wang and Naoyuki Kanda and Sefik Emre Eskimez and Takuya Yoshioka},
journal= {arXiv preprint arXiv:2204.03232},
year = {2022}
}
备注
Submitted to INTERSPEECH 2022