CATSE:一种面向因果目标声音提取的上下文感知框架
音频与语音处理
2024-03-22 v1 人工智能
摘要
目标声音提取(TSE)专注于根据用户提示从输入混合信号中分离出感兴趣的声源。大多数现有解决方案以离线方式运行,不适合增强听力等直播内容应用所施加的低延迟因果处理约束。我们引入了一系列适用于实时处理的上下文感知低延迟因果 TSE 模型。首先,我们通过向 TSE 模型提供关于输入混合信号由哪些声音类别组成的先验信息来探索上下文的效用,模型的目标是提取用户指示的一个或多个感兴趣声源。由于先验模型因其假设而在实际应用中受限,我们引入了一个包含分离和分类损失的复合多任务训练目标。我们涉及单声源和多声源提取的评估表明,在模型中使用上下文信息(通过提供完整上下文或通过所提出的多任务训练损失而不需要完整上下文信息)是有益的。具体而言,我们表明所提出的模型优于尺寸和延迟匹配的 Waveformer——一种用于实时 TSE 的最先进模型。
引用
@article{arxiv.2403.14246,
title = {CATSE: A Context-Aware Framework for Causal Target Sound Extraction},
author = {Shrishail Baligar and Mikolaj Kegler and Bryce Irvin and Marko Stamenovic and Shawn Newsam},
journal= {arXiv preprint arXiv:2403.14246},
year = {2024}
}
备注
Submitted to EUSIPCO 2024