中文

使用基于吸引子正则化的非负张量分解进行音频点成形

声音 2024-07-15 v1 音频与语音处理

摘要

点成形是一种使用多个麦克风阵列的目标说话人提取技术。该方法对每个麦克风阵列应用波束成形(BF),并将BF输出中的公共分量估计为目标源。本研究提出了一种基于非负张量分解(NTF)的新的公共分量提取方法,以提高模型的可解释性,并实现对超参数更鲁棒的点成形。此外,引入了基于吸引子的正则化,以促进在NTF中自动选择最优目标基。实验结果表明,所提方法在点成形性能上优于传统方法,并展现出一些适合实际应用的特性。

关键词

引用

@article{arxiv.2407.08951,
  title  = {Audio Spotforming Using Nonnegative Tensor Factorization with Attractor-Based Regularization},
  author = {Shoma Ayano and Li Li and Shogo Seki and Daichi Kitamura},
  journal= {arXiv preprint arXiv:2407.08951},
  year   = {2024}
}

备注

Accepted at EUSIPCO2024