中文

基于自组织声传感器网络的会议转录空间日记化

音频与语音处理 2023-11-28 v1 声音

摘要

我们提出了一种基于空间信息估计“谁在何时说话”的日记化系统,用作运行在声传感器网络(acoustic sensor network, ASN)所采集信号上的会议转录系统的前端。尽管麦克风的空间分布具有优势,但利用空间分集进行日记化和信号增强颇具挑战,因为麦克风的位置通常未知,且所记录的信号一般初始未同步。在此,我们通过首先盲同步信号然后估计到达时间差(time differences of arrival, TDOAs)来处理这些问题。TDOA信息被用于估计说话人活动,即使在多个说话人同时活跃的情况下也是如此。该说话人活动信息作为空间混合模型的引导,据此通过波束成形提取各个说话人的信号。最后,提取的信号被传送至语音识别器。此外,提出了一种基于TDOA估计的空间混合模型新颖初始化方案。在LibriWASN数据集真实录音上的实验表明,与使用空间混合模型但不利用外部日记化信息的系统相比,我们所提系统更具优势。

关键词

引用

@article{arxiv.2311.15597,
  title  = {Spatial Diarization for Meeting Transcription with Ad-Hoc Acoustic Sensor Networks},
  author = {Tobias Gburrek and Joerg Schmalenstroeer and Reinhold Haeb-Umbach},
  journal= {arXiv preprint arXiv:2311.15597},
  year   = {2023}
}

备注

Accepted at Asilomar Conference on Signals, Systems, and Computers 2023