基于方向和时间戳线索的多通道到多通道目标声提取
音频与语音处理
2024-09-20 v1 人工智能
声音
摘要
我们提出了一个多通道到多通道目标声提取(M2M-TSE)框架,用于从声源的多通道混合信号中分离出多通道目标信号。目标声提取(TSE)使用用户提供的线索来隔离特定的目标信号,通常 focus on 单通道提取,仅使用类别标签或时间激活图。然而,为了保留和利用多通道音频信号中的空间信息,提取声源的多通道信号是必需的。此外,提取的线索还可以包括空间或时间线索,如来到方向(DoA)或源激活的时间戳。为解决这些挑战,我们提出了一个基于时空线索的 M2M 框架,用于提取多通道声音信号。我们展示了基于 transformer 的架构可以依次完成多通道信号的 M2M-TSE 任务,这些信号是从不同房间环境中不同类别音频信号合成的。进一步,我们表明,多通道提取任务为 DNN 引入了足够的归纳偏置,使其能够直接处理 DoA 线索,而无需使用手工制作的空间特征。
引用
@article{arxiv.2409.12415,
title = {Multichannel-to-Multichannel Target Sound Extraction Using Direction and Timestamp Clues},
author = {Dayun Choi and Jung-Woo Choi},
journal= {arXiv preprint arXiv:2409.12415},
year = {2024}
}
备注
5 pages, 4 figures