用于低延迟目标声音提取的在线相似性与独立性感知波束形成器
音频与语音处理
2024-10-07 v2 声音
信号处理
摘要
本研究介绍了一种在线目标声音提取 (TSE) 过程,该过程使用源自迭代批处理算法的相似性与独立性感知波束形成器 (SIBF)。该研究旨在降低延迟同时保持提取精度。作为一种线性方法,SIBF 相比近似幅度谱参考能提供更准确的目标估计。向在线算法的过渡降低了延迟,但也带来了挑战。首先,与传统假设相反,推导在线算法可能会降低精度,相较于使用滑动窗口的批处理算法而言。其次,旨在缩放估计目标的传统后处理方法可能会扩大两种算法之间的精度差距。本研究采用了一种应对这些挑战并在后处理期间最小化精度差距的方法。它提出了一种基于单通道维纳滤波器(基于 SWF 的缩放)的新型缩放方法。为了进一步提高精度,本研究引入了一种修改版的时频变方差广义高斯分布作为源模型,以表示目标与参考之间的联合概率。使用 CHiME-3 数据集的实验结果证明了几个关键发现:1) 基于 SWF 的缩放有效消除了两种算法之间的差距并提高了精度。2) 新的源模型实现了最佳精度,对应于拉普拉斯模型。3) 我们的在线 SIBF 优于传统的线性 TSE 方法,包括独立矢量提取和最小均方误差波束形成。这些发现可为波束形成和盲源分离领域做出贡献。
引用
@article{arxiv.2312.16449,
title = {Online Similarity-and-Independence-Aware Beamformer for Low-latency Target Sound Extraction},
author = {Atsuo Hiroe},
journal= {arXiv preprint arXiv:2312.16449},
year = {2024}
}
备注
Re-submitted to IEEE Open Journal of Signal Processing