基于端到端深度学习的方向特定Ambisonics声源分离
声音
2023-06-21 v2 音频与语音处理
摘要
Ambisonics 是一种基于场景的空间音频格式,与基于对象的格式相比具有若干有用特性,例如高效的整个场景旋转与通用性。然而,它不直接提供各个声源信号,因此在需要时必须从混合信号中分离出这些信号。典型地,这是通过线性球谐(SH)波束成形来实现的。在本文中,我们探索基于深度学习的静态 Ambisonics 混合信号上的声源分离。与大多数分离特定数量特定声音类型声源的方法不同,我们专注于从特定方向分离任意声音。具体而言,我们提出三种将声源分离神经网络与 SH 波束成形相结合的操作模式:精炼模式、隐式模式和混合模式。我们展示神经网络可以隐式地将条件方向与 Ambisonics 场景中包含的空间信息相关联,以提取特定声源。我们在使用 musdb18 数据集生成的音乐混合信号,以及使用 FUSS 数据集生成的用于通用声源分离的混音上,在无混响和房间条件下评估了三种所提方法的性能,并与 SH 波束成形进行比较。结果表明,与传统的 SH 波束成形相比,所提方法具有更好的分离性能和空间选择性。
引用
@article{arxiv.2305.11727,
title = {Direction Specific Ambisonics Source Separation with End-To-End Deep Learning},
author = {Francesc Lluís and Nils Meyer-Kahlen and Vasileios Chatziioannou and Alex Hofmann},
journal= {arXiv preprint arXiv:2305.11727},
year = {2023}
}
备注
Code and listening examples: https://github.com/francesclluis/direction-ambisonics-source-separation