使用虚拟麦克风阵列的会议转录
音频与语音处理
2019-07-09 v2 计算与语言
声音
摘要
我们描述了一个利用虚拟麦克风阵列(一组空间分布的异步录音设备,如笔记本电脑和手机)生成带说话人标注的会议转录文本的系统。该系统由连续音频流对齐、盲波束成形、语音识别、利用先验说话人信息的说话人日记化以及系统融合组成。当使用七个输入音频流时,我们的系统在非重叠语音段上取得了 22.3% 的词错误率(WER),并接近近距离麦克风 WER 的 3% 以内。说话人归属词错误率(SAWER)为 26.7%。相较于单设备系统,SAWER 在三、五、七个麦克风下的相对增益分别为 14.8%、20.3% 和 22.4%。所呈现系统在 10% 语音时长包含多于一个说话人时取得了 13.6% 的日记化错误率。我们还研究了各组件对整体性能的贡献,并在 NIST RT-07 会议测试集上通过实验验证了该系统。
引用
@article{arxiv.1905.02545,
title = {Meeting Transcription Using Virtual Microphone Arrays},
author = {Takuya Yoshioka and Zhuo Chen and Dimitrios Dimitriadis and William Hinthorn and Xuedong Huang and Andreas Stolcke and Michael Zeng},
journal= {arXiv preprint arXiv:1905.02545},
year = {2019}
}