中文

在线音视频会议转录的进展

音频与语音处理 2019-12-12 v1 计算与语言 计算机视觉与模式识别 声音 图像与视频处理

摘要

本文描述了一种利用麦克风阵列和360度摄像头生成带有说话人标注的会议转录稿的系统。该系统的显著特点是能够处理重叠语音,这一直是十多年来现实场景中未解决的难题。我们表明,该问题可通过采用连续语音分离方法来解决。此外,我们描述了一种在线音视频说话人日志方法,该方法利用人脸跟踪与识别、声源定位、说话人识别,以及在可用时的先验说话人信息,以增强对各种现实世界挑战的鲁棒性。所有组件都集成在一个称为SRD(意为“分离、识别与日志标注”)的会议转录框架中。我们给出了使用多达11名参会者的自然会议录音的实验结果。与高度调优的波束成形器相比,连续语音分离将词错误率(WER)降低了16.1%。当提供完整的会议参会者名单时,WER与说话人归属WER之间的差异仅为1.0%,表明词到说话人的关联准确。当系统中50%的参会者未知时,该差异仅略微增加到1.6%。

关键词

引用

@article{arxiv.1912.04979,
  title  = {Advances in Online Audio-Visual Meeting Transcription},
  author = {Takuya Yoshioka and Igor Abramovski and Cem Aksoylar and Zhuo Chen and Moshe David and Dimitrios Dimitriadis and Yifan Gong and Ilya Gurvich and Xuedong Huang and Yan Huang and Aviv Hurvitz and Li Jiang and Sharon Koubi and Eyal Krupka and Ido Leichter and Changliang Liu and Partha Parthasarathy and Alon Vinnikov and Lingfeng Wu and Xiong Xiao and Wayne Xiong and Huaming Wang and Zhenghao Wang and Jun Zhang and Yong Zhao and Tianyan Zhou},
  journal= {arXiv preprint arXiv:1912.04979},
  year   = {2019}
}

备注

To appear in Proc. IEEE ASRU Workshop 2019