中文

Neural Steerer:基于频率与声源位置因果神经场的新型导向矢量合成

音频与语音处理 2024-03-04 v4 声音

摘要

我们解决了利用称为神经场的深度学习框架精确插值实测无混响导向矢量的问题。该任务在减少精确声源分离与定位所需的资源密集型测量方面起着关键作用,而后者是语音识别前端所必需的。经典的插值方法依赖于在固定离散频率集上对已测空间邻近点的线性加权。受计算机视觉中神经场用于新视角合成成功的启发,我们引入了 neural steerer,一种连续的复值函数,以频率和方位同时为输入并输出相应导向矢量。重要的是,它融合了通道间相位差信息以及强制滤波器因果性的正则化项,这对准确的导向矢量建模至关重要。我们使用真实实测导向矢量数据集开展的实验表明,我们这种与分辨率无关的模型在插值此类测量上十分有效。

关键词

引用

@article{arxiv.2305.04447,
  title  = {Neural Steerer: Novel Steering Vector Synthesis with a Causal Neural Field over Frequency and Source Positions},
  author = {Diego Di Carlo and Aditya Arie Nugraha and Mathieu Fontaine and Mathieu Fontaine and Kazuyoshi Yoshii},
  journal= {arXiv preprint arXiv:2305.04447},
  year   = {2024}
}

备注

Camera ready version for HSCMA 24 at ICASSP 24