中文

一种用于自组织声学传感器网络的会议转录系统

音频与语音处理 2022-05-03 v1 声音

摘要

我们提出一种系统,用于转录由一组初始未同步、位置未知的麦克风阵列所捕获的典型会议场景对话。该系统由信号同步(包括采样率与采样时间偏移估计)、基于说话人与麦克风阵列位置估计的说话人日志划分、多通道语音增强以及自动语音识别等子系统构成。利用估计的说话人日志信息,初始化一个空间混合模型,用于估计波束成形系数以进行源分离。仿真表明,与单一紧凑麦克风阵列相比,通过同步并组合多个分布式麦克风阵列可提升语音识别准确率。此外,所提出的空间混合模型有信息初始化相较随机初始化具有明确的性能优势。

关键词

引用

@article{arxiv.2205.00944,
  title  = {A Meeting Transcription System for an Ad-Hoc Acoustic Sensor Network},
  author = {Tobias Gburrek and Christoph Boeddeker and Thilo von Neumann and Tobias Cord-Landwehr and Joerg Schmalenstroeer and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2205.00944},
  year   = {2022}
}

备注

Submitted to INTERSPEECH 2022