基于自组织声传感器网络的会议转录空间日记化
音频与语音处理
2023-11-28 v1 声音
摘要
我们提出了一种基于空间信息估计“谁在何时说话”的日记化系统,用作运行在声传感器网络(acoustic sensor network, ASN)所采集信号上的会议转录系统的前端。尽管麦克风的空间分布具有优势,但利用空间分集进行日记化和信号增强颇具挑战,因为麦克风的位置通常未知,且所记录的信号一般初始未同步。在此,我们通过首先盲同步信号然后估计到达时间差(time differences of arrival, TDOAs)来处理这些问题。TDOA信息被用于估计说话人活动,即使在多个说话人同时活跃的情况下也是如此。该说话人活动信息作为空间混合模型的引导,据此通过波束成形提取各个说话人的信号。最后,提取的信号被传送至语音识别器。此外,提出了一种基于TDOA估计的空间混合模型新颖初始化方案。在LibriWASN数据集真实录音上的实验表明,与使用空间混合模型但不利用外部日记化信息的系统相比,我们所提系统更具优势。
引用
@article{arxiv.2311.15597,
title = {Spatial Diarization for Meeting Transcription with Ad-Hoc Acoustic Sensor Networks},
author = {Tobias Gburrek and Joerg Schmalenstroeer and Reinhold Haeb-Umbach},
journal= {arXiv preprint arXiv:2311.15597},
year = {2023}
}
备注
Accepted at Asilomar Conference on Signals, Systems, and Computers 2023