块在线引导源分离
音频与语音处理
2020-11-17 v1 声音
信号处理
摘要
我们提出一种引导源分离(GSS)的块在线算法。GSS 是一种利用说话人日志信息来更新观测信号生成模型参数的语音分离方法。先前研究表明 GSS 在多说话人场景中表现良好。然而,它需要大量计算时间,这阻碍了在线应用的部署。此外,离线 GSS 是一种按语句处理的算法,因此会产生随语句长度而定的延迟。在所提算法中,块级输入样本及相应时间标注与前述上下文中的样本和标注拼接,并用于更新参数。利用上下文使得算法仅通过每块一次优化迭代即可准确估计时频掩码,且其延迟不依赖于语句长度而取决于预定的块长度。它还通过仅更新每块及其上下文中活跃说话人的参数来降低计算成本。在 CHiME-6 语料库和会议语料库上的评估表明,所提算法取得了与常规离线 GSS 算法几乎相同的性能,但计算速度提升 32 倍,足以满足实时应用需求。
引用
@article{arxiv.2011.07791,
title = {Block-Online Guided Source Separation},
author = {Shota Horiguchi and Yusuke Fujita and Kenji Nagamatsu},
journal= {arXiv preprint arXiv:2011.07791},
year = {2020}
}
备注
Accepted to SLT 2021