结合迭代铸造与启动加速且具备相似性与独立性感知的参考目标声源提取波束形成器
音频与语音处理
2021-10-22 v1 声音
摘要
目标声源提取对于提高人类语音可懂度和计算机的语音识别性能具有重要意义。本研究描述了一种目标声源提取方法,称为相似性与独立性感知波束形成器(SIBF)。SIBF使用粗略幅度频谱图作为参考信号来提取目标声源。SIBF的优势在于,与基于深度神经网络的语音增强等目标增强方法生成的频谱图相比,它能获得更准确的信号。为了进行提取,我们扩展了收缩独立成分分析(ICA)框架,除了考虑所有潜在声源的相互独立性外,还考虑了参考信号与提取出的目标声源之间的相似性。为了通过最大似然估计解决提取问题,我们引入了三种能够反映相似性的声源模型。本研究的主要贡献如下。首先,通过两种方法提高了提取性能,即用于更快收敛的启动加速和用于生成更准确参考的迭代铸造。通过使用CHiME3数据集的实验验证了这些方法的有效性。其次,发展了关于准确度的不动点概念。这一概念有助于理解参考信号与SIBF输出在准确度方面的关系。第三,实现了SIBF与基于掩膜的波束形成器的统一表述,以将传统波束形成器的专业知识应用于SIBF。本研究的发现也能提高SIBF的性能,并促进ICA和传统波束形成器的研究。
引用
@article{arxiv.2110.09019,
title = {Similarity-and-Independence-Aware Beamformer with Iterative Casting and Boost Start for Target Source Extraction Using Reference},
author = {Atsuo Hiroe},
journal= {arXiv preprint arXiv:2110.09019},
year = {2021}
}
备注
Accepted for publication as a regular paper in the IEEE Open Journal of Signal Processing (2021)