统一掩模基准束器框架内的所有变体是否能够实现相同的峰值提取性能?
信号处理
2025-02-25 v2 声音
音频与语音处理
摘要
本研究探讨了基于掩模的束器(BF),它们使用时间频率掩模来估计目标声提取(TSE)的滤波器。虽然提出了多种基于掩模的束器,但尚未达成关于哪一种提供最佳目标提取性能的共识。我们之前发现,最大信噪比和最小均方误差(MSE)束器可以实现与理论上限性能相同的提取性能,每个束器包含不同的最优掩模。然而,仍有两个问题未解决:仅涵盖两种束器,不包括最小方差无失真响应束器;以及采用理想缩放(IS)来理想地调整输出缩放,这在现实场景中并不适用。为了解决这些问题,本研究提出了一个覆盖所有可能束器的统一框架,包括两个过程:能够覆盖所有可能束器的滤波器估计,以及通过使用掩模生成缩放参考来适用于现实场景的缩放。基于束器公式中使用的算子和协方差矩阵,所有可能的束器可以分为 12 种变体,包括两种新变体。通过最小化目标与束器输出之间的 MSE 来获得两个过程的最优掩模。使用 CHiME-4 数据集进行的实验结果表明,1)所有 12 种变体都可以实现理论上限性能,2)基于掩模的缩放可以像 IS 一样工作,即使对非负掩模的时间均值施加限制也是一个。这些结果可以通过考虑掩模的实际参数数量来解释。这些发现有助于 1)设计 TSE 系统,2)通过基于掩模的缩放提高缩放精度,3)估计束器的提取性能。
引用
@article{arxiv.2407.15310,
title = {Can all variations within the unified mask-based beamformer framework achieve identical peak extraction performance?},
author = {Atsuo Hiroe and Katsutoshi Itoyama and Kazuhiro Nakadai},
journal= {arXiv preprint arXiv:2407.15310},
year = {2025}
}
备注
Accepted for publication in EURASIP journal on Audio, Speech, and Music Processing