面向会议转录的 GPU 加速引导源分离
音频与语音处理
2023-08-15 v2 声音
摘要
引导源分离(GSS)是一种目标说话人提取方法,它依赖于预先计算的说话人活动和盲源分离来对重叠语音信号进行前端增强。它最初在 CHiME-5 挑战赛中提出,相比延迟求和波束成形基线提供了显著改进。尽管有其优势,该方法在会议转录基准测试中采用有限,主要由于其计算耗时高。在本文中,我们描述了改进的 GSS 实现,其利用现代基于 GPU 的流水线(包括频率和片段的批处理)来提供相比基于 CPU 的推理 300 倍的加速。改进的推理时间使我们能够对 GSS 算法的若干参数(例如上下文时长、通道数和噪声类别等)进行详细的消融研究。我们提供了用于流行会议基准 LibriCSS、AMI 和 AliMeeting 的说话人归属转录的端到端可复现流水线。我们的代码和配方公开可用:https://github.com/desh2608/gss。
引用
@article{arxiv.2212.05271,
title = {GPU-accelerated Guided Source Separation for Meeting Transcription},
author = {Desh Raj and Daniel Povey and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2212.05271},
year = {2023}
}
备注
7 pages, 4 figures. To appear at InterSpeech 2023. Code available at https://github.com/desh2608/gss